跳到正文
OpenReview · State space models· Saghar Adler; Vijay G. Subramanian·· 2023-01-01精选AI 评分80

可数无限状态空间马尔可夫决策过程中的最优策略贝叶斯学习

Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space

AI 导读

基于摘要分析。本文研究未知动力学下可数无限状态空间 Markov Decision Processes(MDPs)的最优控制,针对有限状态学习算法不能直接适用的问题,提出采用动态长度回合的 Thompson sampling 算法,并给出贝叶斯遗憾上界。主要研究对象是通信网络或计算系统等排队模型,而非神经信号建模;这里的状态空间也不指用于序列建模的 State Space Model 架构。 问题设定为离散时间 MDP:状态空间为 Z_+^d,动作空间 A 有限,代价函数无界,未知参数 θ 服从给定的固定先验。每个回合开始时,算法通过 Bayes 规则更新后验并采样参数估计,再据此选择该回合执行的策略。摘要未说明动态回合长度的具体确定规则。 作者报告,在用于保证所选策略诱导的马尔可夫链稳定性的遍历性假设下,结合平均代价 Bellman 方程的解,可建立 Õ(d h^d √(|A|T)) 的贝叶斯遗憾上界,其中 T 为时间范围,d 为状态空间维度,|A| 为动作数量;摘要未解释 h 的含义。该结果是特定模型与假设下的理论上界,不是经验性能分数。作者还以两种未知动力学的排队模型说明算法可用于构建近似最优控制方法,但具体模型、验证方式和对照结果尚未验证。 复现或核对理论时,应重点确认遍历性条件的适用范围、无界代价的控制条件、平均代价 Bellman 方程的求解要求,以及后验更新和策略计算的可行性。全文、证明细节、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若某类闭环 BCI 控制可明确表述为未知参数驱动的 MDP,回合级后验采样或可作为探索与控制的候选机制;但摘要没有建立这种对应,且神经状态的可观测性、非平稳性及安全探索约束是否满足其理论假设尚不清楚,因此暂不提出具体 EEG 迁移实验。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是其在可数无限状态空间、无界代价与遍历性假设下对 Thompson sampling 建立贝叶斯遗憾上界的理论路径,但这不构成 EEG 解码或 BCI 控制有效性的证据。

来源:OpenReview · State space models · openreview.net