模仿式初始化帮助状态空间模型学习回忆
Mimetic Initialization Helps State Space Models Learn to Recall
基于摘要分析。本文研究 Mamba 等状态空间模型在复制与关联回忆任务上的训练困难,提出一种结构化初始化,使状态空间层更容易模仿注意力机制。作者报告,在多种架构设置下,该初始化显著降低了 Mamba 从头学习复制与关联回忆任务的难度;摘要未提供具体指标与改善幅度。 核心问题是容量限制与优化困难的区分:状态空间模型的状态大小不随输入序列长度增长,这被用于解释其在回忆类任务上弱于 Transformers 的表现;作者则提出,实际模型的状态通常较大,已有表现可能尚未充分发挥其容量。方法依据对模型“attention”映射的观察设计初始化,而非在摘要中提出扩大状态容量的方案。初始化的具体参数构造、训练目标、任务生成方式、序列长度、架构设置、对照基线及消融和统计信息尚未验证,因此不能据此认定固定状态的容量瓶颈已被解决。 平台推测(待验证):若 EEG 长序列解码确实需要保留较早出现的事件线索,该初始化可能有助于检验状态空间模型是否存在可改善的记忆训练瓶颈。原论文面向复制和关联回忆,迁移依赖 EEG 任务中存在可学习的时序线索及对应监督,不能把符号序列上的改善直接视为 BCI 有效性证据。可复用候选是状态空间层的初始化;输入编码、时间尺度和任务读出需适配 EEG。低信噪比、通道差异、跨被试变化及小数据训练均可能使模仿注意力的初始结构无法带来收益。一个可检验的小实验是在固定 EEG 数据划分、模型容量和训练预算下,对比默认初始化与该初始化,检查不同线索延迟下的解码表现及训练稳定性。相关 EEG 工作尚未检索确认。
值得阅读的具体原因是:作者用结构化初始化检验 Mamba 的复制与关联回忆困难是否部分源于训练而非容量限制,但改善幅度与对照协议尚需全文核对。
来源:OpenReview · State space models · openreview.net