跳到正文
OpenReview · State space models· Qiwen Cui; Kaiqing Zhang; Simon Shaolei Du·· 2023-06-20精选AI 评分84

打破大状态空间中的多智能体维度灾难:采用独立线性函数逼近的 Markov 博弈强化学习

Breaking the Curse of Multiagents in a Large State Space: RL in Markov Games with Independent Linear Function Approximation

AI 导读

基于摘要分析。本文研究大状态空间、多智能体条件下的强化学习均衡求解,提出 independent linear Markov game:每个智能体独立逼近由其他参与者策略边缘化后的状态—动作价值函数。主要贡献是学习 Markov 粗相关均衡(CCE)与 Markov 相关均衡(CE)的算法及样本复杂度保证,而非神经信号建模或 BCI 解码方法。 核心机制包括两点:一是通过策略回放(policy replay)处理多个智能体及函数逼近带来的非平稳性;二是将均衡学习与探索分离,使算法可以使用全信息无遗憾学习 oracle,而非摘要所述表格型方法采用的、更强要求的 bandit-feedback 无遗憾学习 oracle。作者报告,复杂度界对各智能体自身函数类复杂度仅呈多项式依赖;相比之下,既有函数逼近方法在特化为典型表格型 Markov 博弈时,其界依赖随智能体数量指数增长的联合动作空间规模。该结论仍需结合正文中的模型假设与其他参数依赖理解。 作者还提出迭代最优响应型算法,用于在 independent linear Markov potential games 中学习纯 Markov Nash 均衡,并指出拥塞博弈中的应用。在表格型 Markov 博弈的 CCE 学习问题中,作者报告将样本复杂度从所引 Daskalakis 等人工作的 Õ(ε⁻³) 改进为 Õ(ε⁻²),其中 ε 为目标精度,Õ 隐去对数因子;这一比较是理论复杂度比较,不是数据集上的实测性能。作者另声称提出首个打破多智能体维度灾难的可证明高效 Markov CE 学习算法,优先性尚未独立核实。 摘要未提供完整采样协议、线性可实现性条件、oracle 实现要求或实验结果,具体定理条件及复现条件尚未验证。材料没有建立多智能体均衡学习与 EEG/BCI 问题的具体对应关系,因此不据此提出 BCI 迁移效果或复现实验;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其通过独立线性函数逼近与策略回放降低多智能体均衡学习样本复杂度的理论机制,但保证的适用假设及其与 BCI 的关系尚需核对。

来源:OpenReview · State space models · openreview.net