跳到正文
OpenReview · State space models· Saghar Adler; Vijay G. Subramanian·· 2023-01-01精选AI 评分80

可数无限状态空间马尔可夫决策过程中的最优策略贝叶斯学习

Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space

AI 导读

基于摘要分析。本文研究通信网络或计算系统排队模型等可数无限状态控制问题,针对有限状态学习方法不能直接适用的情形,提出采用动态长度回合的 Thompson sampling 算法,并分析其贝叶斯遗憾。主要对象是未知动力学下的 MDP 最优控制,而非 EEG 解码或神经信号状态空间建模。 问题设定为离散时间 MDP:状态空间为 Z_+^d,动作空间 A 有限,成本函数无界,动力学由未知参数 θ 决定。贝叶斯设定假定真实参数由给定的固定先验生成。每个回合开始时,算法通过 Bayes 规则更新后验并抽取参数估计,再据此选择该回合执行的策略;摘要未说明回合长度的具体调整规则。 作者通过遍历性假设约束各参数对应策略下的马尔可夫链稳定性,并结合平均成本 Bellman 方程的解,报告贝叶斯遗憾上界为 Õ(d h^d √(|A|T)),其中 T 为时间范围、d 为状态空间维度、|A|为动作空间大小。该上界依赖论文所设理论条件;摘要未定义 h,其含义及相关常数、适用范围尚未验证,不能据此直接判断高维问题的实际可扩展性。 作者还讨论两个动力学未知的排队模型,说明算法可用于构造近似最优控制算法。摘要未提供模型细节、数值指标或对照结果,全文中的假设验证、求解方式及实验协议尚未验证。阅读时应重点核对后验更新与策略求解是否可计算,以及遍历性条件在具体系统中如何成立。材料未建立与 EEG/BCI 的具体机制对应关系,因此不将该理论结果解释为 BCI 有效性证据,也不据此提出迁移实验。

阅读价值

值得阅读的具体原因是,作者将动态长度回合的 Thompson sampling 扩展到可数无限状态、无界成本的 MDP,并在遍历性假设下给出贝叶斯遗憾上界,可用于核对这类控制问题的稳定性条件与理论适用边界。

来源:OpenReview · State space models · openreview.net