能选择性检索,却不能广泛检索:状态空间模型中的检索容量与可访问性
Selective but Not Broad: Retrieval Capacity and Accessibility in State-Space Models
基于摘要分析。本文研究 Mamba 等状态空间模型(SSM)为何能完成 associative recall、MQAR 等选择性检索,却难以完成要求所有输入位置保持可辨识的广泛检索,例如 Position Recovery(PR)。核心贡献是区分记忆容量与训练可访问性,并用理论分析、课程训练干预和受控目标比较检验检索失败的来源。 机制上,作者将检索建模为在序列各位置之间分配固定的逐位置信噪比预算:选择性检索按内容寻址,广泛检索按位置寻址。作者在所分析的线性 SSM 通道设定下证明,单通道无法解决 filler recall,因此需要通道专门化;广泛检索所需检索秩随序列长度增长,选择性检索则随键数量增长,时间尺度还须匹配被查询信息的时间距离。摘要称,训练权重呈现理论预测的选择性检索坍塌结构及成功模型的专门化特征,包括 multi-scale RetNet 对理论 1/m 关系的跟随;理论适用范围是线性化状态映射。 作者报告,在项目自有检查点上的对称因果干预中,课程训练使标准 SSM 获得广泛检索能力,并迁移至选择性检索;也能在标准 SGD 失败的较低容量门槛处解锁选择性检索。在全部已测试规模上,两类缺陷均表现为可访问性受限,训练障碍持续至 122M 参数规模。受控 Pareto 比较中,纯语言建模的广泛检索表现停留在随机水平,加入广泛检索目标的 PPL 代价依赖架构。作者另报告,两类模型家族的 2.7B 参数开放预训练检查点均复现了冻结探针无法检出广泛检索信息的现象;这并不等于对这些检查点实施了上述因果干预。 实验协议、任务划分、课程构造、探针形式、消融及统计信息尚未验证。平台推测(待验证):该机制可能帮助分析 EEG 长序列中短暂事件的可恢复性,但需将离散键和位置任务改造成连续信号与事件监督,并适配通道和时间尺度;低信噪比、跨被试差异及小数据可能削弱课程训练效果。一个可证伪的小实验是固定模型与数据预算,对照普通训练和检索课程训练,同时测量事件检索与位置恢复,而不只观察下游分类。此迁移尚未验证,已有 EEG 相关工作尚未检索确认。
值得阅读之处在于以检索秩、时间尺度配置及课程训练干预区分 SSM 的记忆容量与训练可访问性,但结论需限定于其线性化理论和已测试任务,尚不能视为 EEG 长序列建模的有效性证据。
来源:OpenReview · State space models · openreview.net