用于上下文强化学习的结构化状态空间模型
Structured State Space Models for In-Context Reinforcement Learning
基于摘要分析。本文研究 Structured State Space Sequence(S4)模型如何用于上下文强化学习,核心贡献是修改一种 S4 变体,使隐藏状态能够并行初始化与重置,并利用长序列建模能力处理需要记忆和任务适应的强化学习问题。 机制与对照:S4 的快速推理和可并行训练是作者采用该架构的动机;新增的状态初始化与重置能力旨在适配强化学习任务。作者报告,修改后的架构在渐近运行效率上优于 Transformers,并在一个简单的记忆型任务上表现优于 LSTM。摘要未给出具体复杂度表达式、实测延迟、任务设置或性能数值,不能将渐近优势直接解释为所有运行条件下更快。 评估对象:更具挑战性的实验是元学习任务,智能体面对随机采样的连续控制环境,同时环境的观测与动作经过随机采样的线性投影。作者报告模型在该设置中表现较强,并能够适应分布外的留出任务。具体训练目标、交互序列组织、留出划分、指标、对照结果、消融及统计信息尚未验证;作者据此提出 S4 有望成为上下文强化学习的默认架构候选,而非证明其普遍优于其他架构。 平台推测(待验证):假设 BCI 应用被明确建模为需要跨轮次记忆与在线适应的交互控制任务,其长序列状态建模及状态重置机制可能具有借鉴价值。可复用的是序列骨干与重置机制,需改造的是 EEG 输入表征、动作接口和奖励定义;原实验依赖环境交互及随机线性投影,这些条件不等同于真实跨被试或跨通道变化。低信噪比、小数据及非线性分布变化可能使迁移失败。一个可检验的小实验是在固定 EEG 表征和相同交互预算下,对比修改后的 S4 与 LSTM 在离线 BCI 控制模拟中的任务适应表现及推理耗时,并明确控制模拟与真实闭环验证的区别。已有 EEG 相关工作尚未检索确认。
值得核对其隐藏状态并行初始化与重置机制,以及随机观测/动作投影下的上下文适应能力;摘要支持其作为强化学习序列架构的研究价值,但不构成 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net