跳到正文
OpenReview · State space models· Saghar Adler; Vijay Subramanian·· 2023-09-22精选AI 评分80

可数无限状态空间马尔可夫决策过程中的最优策略贝叶斯学习

Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space

AI 导读

基于摘要分析。本文研究动力学受未知参数控制、状态空间可数无限且成本函数无界的离散时间 Markov Decision Processes(MDPs),提出采用动态长度分段的 Thompson sampling 算法,并分析其贝叶斯遗憾。主要研究对象是通信网络或计算系统等场景中的排队控制,而非 EEG 解码或 BCI 算法。 问题设定中,状态空间为 Z_+^d,动作空间 A 有限,未知参数由给定的固定先验分布生成。算法在每个分段开始时,根据历史观测通过贝叶斯规则形成后验分布,再从后验中采样参数,并据此确定该分段执行的策略。摘要没有给出分段长度的具体更新规则、后验计算方式或策略求解实现,这些细节尚未验证。 理论分析的关键是对各参数对应策略所诱导的马尔可夫链施加遍历性假设,以保障稳定性,并利用平均成本 Bellman 方程的解建立遗憾界。作者报告,在这些假设及所述贝叶斯设定下,算法的 Bayesian regret 上界为 Õ(d h^d √(|A|T)),其中 T 为时间范围,d 为状态空间维度,|A|为动作数;摘要未解释 h 的定义及其适用条件,不能将该界视为无条件保证。该结果是理论上界,不是实验性能指标。 作者还报告以两个动力学未知的排队模型说明算法可用于构造近似最优控制方法,但摘要未提供具体模型、对照方法、实验指标或实现资源。复现前需核对遍历性条件如何在实例中成立、平均成本策略如何求解,以及动态分段与后验更新的计算开销。本文处理的是 MDP 中的序贯控制;不能仅因来源归入 State space models 就将其解读为神经序列建模架构。其与 EEG/BCI 的具体机制对应尚未建立,相关工作也尚未检索确认。

阅读价值

值得阅读之处在于将基于 Thompson sampling 的贝叶斯控制分析扩展到可数无限状态空间与无界成本的 MDP,并明确以遍历性假设支撑稳定性及遗憾界;其对 BCI 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net