跳到正文
OpenReview · State space models· Qiwen Cui; Kaiqing Zhang; Simon Shaolei Du·· 2023-06-17精选AI 评分84

突破大状态空间中的多智能体维数灾难:采用独立线性函数近似的 Markov 博弈强化学习

Breaking the Curse of Multiagents in a Large State Space: RL in Markov Games with Independent Linear Function Approximation

AI 导读

基于摘要分析。本文研究大状态空间、多智能体条件下的 Markov 博弈强化学习,提出 independent linear Markov game,使各智能体独立近似经其他参与者策略边缘化后的状态—动作价值函数,并据此学习 Markov 粗相关均衡(CCE)与 Markov 相关均衡(CE)。主要贡献是以独立函数近似及新的学习机制,避免样本复杂度随联合动作空间规模产生的多智能体维数灾难。 核心机制包括:使用 policy replay 应对多智能体学习与函数近似引起的非平稳性;将探索与 Markov 均衡学习分离,使算法能够采用 full-information no-regret learning oracle,而非表格型设置中使用的更强 bandit-feedback no-regret learning oracle。这里的理论依赖是各智能体具有相应的独立线性价值函数近似结构,不能直接扩展为任意多智能体环境中的效率保证。 作者报告,学习 Markov CCE 与 CE 的样本复杂度界对各智能体自身函数类复杂度呈多项式依赖;作为对照,已有函数近似方法在特化为标准表格型 Markov 博弈时,其复杂度界依赖联合动作空间规模,而该规模可随智能体数量指数增长。在表格型 Markov CCE 学习设置下,作者报告将关于目标精度 ε 的样本复杂度从所引工作的 Õ(ε⁻³) 改善至 Õ(ε⁻²),并改善其他问题参数;摘要未给出完整参数依赖,不能据此判断具体环境中的样本量。作者另提出迭代最佳响应型算法,在 independent linear Markov potential games 中学习纯 Markov Nash 均衡,并指出拥塞博弈应用;其“首个突破多智能体维数灾难的可证明高效 Markov CE 算法”属于作者声明。 本文主要对象是多智能体强化学习理论,而非神经信号建模;来源栏目中的 State space models 不意味着本文研究序列状态空间模型。全文中的线性可实现性条件、交互与反馈假设、均衡误差定义、完整复杂度界及实验协议尚未验证。材料尚未提供与 EEG/BCI 的具体机制对应关系,因此不据此提出迁移效果或复现实验建议;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其通过 policy replay 与探索—均衡学习分离来控制多智能体非平稳性及样本复杂度的理论机制,但其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net