跳到正文
OpenReview · State space models· Mahsa Asadi; Mohammad Sadegh Talebi; Hippolyte Bourel; Odalric-Ambrym Maillard·· 2019-11-01精选AI 评分81

利用状态—动作等价性的基于模型的强化学习

Model-Based Reinforcement Learning Exploiting State-Action Equivalence

AI 导读

该研究关注转移分布未知的 Markov Decision Process(MDP),提出利用状态—动作对之间的等价结构共享统计信息,以改善基于模型的强化学习置信界与遗憾表现。基于摘要分析,未取得论文全文。 核心机制是通过不同状态—动作对的转移概率相似性定义等价结构。当学习者预先知道该结构时,作者给出等价结构感知的置信界,并报告其可证明地比不利用等价结构的对应置信界更紧。对于结构未知的情形,作者提出 ClusteringAlgo,寻找近似等价结构,再据此构造置信界;具体相似性定义、聚类准则及误差处理尚未验证。 作者将上述机制用于 CUCRL,作为 UCRL 在无折扣 MDP 中的修改版本。作者报告:在等价结构已知、具有 S 个状态、A 个动作和 C 个等价类的 communicating MDP 中,相较 UCRL,CUCRL 的遗憾界获得 √(SA/C) 倍的改进;该结论对应已知结构的理论条件,不能直接外推至结构未知的情况。对于未知结构,作者报告 CUCRL 与 ClusteringAlgo 结合在 ergodic MDP 的数值实验中优于 UCRL,但摘要未给出具体实验规模、数值指标或统计信息。 平台推测(待验证):这一机制可能适用于具有重复转移规律的 BCI 自适应交互决策,而非直接作为 EEG 表征学习方法。假设多个状态—动作对确有稳定的转移等价性,可复用置信界和聚类思路;需改造的是神经信号到离散状态的映射,以及等价关系在不同被试和会话中的检验。EEG 低信噪比、小样本及状态非平稳性可能导致错误合并,使统计共享失效。一个可证伪的小实验是在具有可控等价结构的模拟 BCI 交互 MDP 中,固定交互预算,比较 UCRL 与 CUCRL,并逐步扰动等价关系,检查累计遗憾及置信界覆盖率。该实验仅检验机制迁移假设;已有 EEG 相关工作尚未检索确认。完整理论条件、实验协议、消融及统计信息尚未验证。

阅读价值

值得核对其利用状态—动作等价结构收紧转移概率置信界的理论机制,尤其是已知结构下的遗憾改进与未知结构下聚类误差的影响;摘要未提供 EEG 或 BCI 有效性证据。

来源:OpenReview · State space models · openreview.net