通过抽象状态空间动态专门化实现自动策略分解
Automatic Policy Decomposition through Abstract State Space Dynamic Specialization
基于摘要分析。本文研究深度强化学习中 options(面向子目标的策略或动作宏)可能扩大动作搜索空间的问题,提出在 DQN 的高层引入多个专门化头,分别学习状态空间局部区域的动力学与最优策略,并根据状态预测质量确定各头对当前策略的贡献。 核心机制是利用状态空间的连接结构:作者认为,状态空间通常存在内部连接较密集、区域间连接较少的局部区域。模型据此分解策略学习任务,以各头的状态预测质量判断其是否为当前状态的局部专家。与将 options 作为各处均可选择的动作相比,该方法尝试通过局部专家的贡献分配组织策略,而非单纯增加候选动作。摘要未说明区域如何形成、预测目标与损失如何定义,以及专家贡献如何组合,相关实现尚未验证。 作者报告,该方法能够学习类似 options 和 generalized value function 的行为或表示。摘要未提供任务、环境、对照基线或量化指标,因此不能据此判断其性能优势、样本效率或泛化能力;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 驱动的交互控制任务具有可重复的局部状态结构,这种基于动力学预测质量的专家加权机制可能用于策略切换,但原论文研究的是强化学习策略分解,并非 EEG 解码。迁移依赖可定义的状态、动作、奖励及连续交互数据;可复用的是多头策略和专家加权思路,需改造 EEG 状态表征与预测目标。低信噪比、跨被试差异、通道变化和小数据可能使预测质量更多反映观测噪声,而非专家对局部动力学的掌握。一个可检验的小实验是在固定 EEG 状态表征及相同交互预算下,对比单头 DQN 与该多头机制的任务回报和专家分配稳定性。相关 EEG 工作尚未检索确认。
来源:OpenReview · State space models · openreview.net