S4++:通过 State Memory Reply 提升长序列建模
S4++: Elevating Long Sequence Modeling with State Memory Reply
基于摘要分析。该研究针对状态空间模型(SSM)长序列建模中的非稳定状态(Non-Stable-States,NSS)与依赖偏置问题,提出 State Memory Reply(SMR)机制,通过可学习记忆将多状态信息纳入当前状态形成 S4+,并进一步引入交互式交叉注意力构建 S4++。 机制与贡献:作者从摘要所称的 ETC 控制理论视角分析 SSM,提出离散采样步骤之间的状态方差差异可能导致发散,并将 NSS 主要归因于采样步骤。作者认为,向当前状态整合多状态输入有助于缓解 NSS;SMR 据此利用可学习记忆刻画更细粒度的状态依赖。针对单向状态依赖难以表达复杂依赖的问题,S4++ 在 S4+ 基础上加入交互式交叉注意力。摘要未给出状态记忆的组织方式、更新规则、注意力连接方式及计算复杂度,理论假设与稳定性结论的适用范围尚需正文核对。 实验与证据边界:作者报告,在自回归语言建模及 Long Range Arena 基准评估中,该方法在多数任务上表现更优;摘要将这些任务称为“post-processing tasks”,具体含义尚未验证。材料未提供分数、对照基线、数据划分或训练配置,因此不能量化收益,也不能判断 SMR 与交叉注意力的独立贡献。实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,多状态记忆可能帮助 EEG 长序列模型保留跨时间信息,但原领域结果不等于 EEG/BCI 有效。可复用部分是状态记忆与依赖建模机制;需改造输入表示、通道融合和采样率适配。低信噪比可能使记忆累积伪迹,跨被试差异、通道变化及小数据也可能削弱可学习记忆的泛化。一个可检验的小实验是在固定 EEG 任务与相同划分、训练预算下,对比基础 SSM、加入 SMR 和完整 S4++,分别考察被试内与跨被试表现及状态方差,检验状态稳定性变化是否伴随任务收益。已有 EEG 相关工作尚未检索确认。
来源:OpenReview · State space models · openreview.net