Decision Mamba:用于离线强化学习的具有自演化正则化的多粒度状态空间模型
Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL
基于摘要分析。本文研究离线强化学习(Offline RL)中的条件序列建模,提出 Decision Mamba(DM),以多粒度状态空间模型(SSM)结合自演化策略学习,处理历史时序信息利用不足、时间步内状态—动作—剩余回报(return-to-go,RTG)关系建模不足,以及对含噪次优轨迹过拟合的问题。 机制上,DM 使用 Mamba 架构显式建模历史隐状态,以提取跨时间步信息;同时将细粒度 SSM 模块整合到原有粗粒度 SSM 中,捕捉同一时间步内状态、动作与 RTG 三元组的关系。自演化策略通过渐进式正则化,利用策略自身的历史知识修正次优动作。其具体正则化形式、动作修正流程与训练调度尚未验证。 作者报告,DM 在多种任务的实验中显著优于其他基线,但摘要未提供任务或数据集名称、划分协议、基线明细、指标及数值,因此无法判断优势幅度与适用边界。实验协议、消融及统计信息尚未验证;尤其需核对多粒度 SSM 与自演化正则化各自的贡献,以及分布外状态和动作、示范噪声的评估方式。 平台推测(待验证):该方法更可能对应基于 EEG 状态表征的离线闭环控制策略学习,而非直接用于 EEG 分类。迁移假设依赖可用的状态—动作—奖励轨迹及可信的 RTG:跨时间步模块可用于建模控制历史,时间步内模块需适配 EEG 状态与设备动作,自演化机制需防止将错误动作反复强化。低信噪比、跨被试与通道变化可能使状态表征失稳,小数据及奖励不可靠也可能削弱策略修正效果。一个可检验的小实验是在固定 EEG 表征和相同轨迹划分下,对比完整 DM、移除细粒度模块及移除自演化正则化的版本,使用可重复的离线控制评估检验噪声扰动下的策略收益;这不等于在线 BCI 有效性验证。已有 EEG 相关工作尚未检索确认。
值得核对其跨时间步与时间步内关系的多粒度建模,以及利用历史策略知识修正次优动作的正则化机制;摘要中的性能优势尚需结合实验协议验证,不能直接视为 BCI 有效性证据。
来源:OpenReview · State space models · openreview.net