Transformers 与状态空间模型的机制评估
Mechanistic evaluation of Transformers and state space models
基于摘要分析。本文研究语言建模架构为何在上下文信息检索上表现不同,通过 Associative Recall(AR)及新提出的层级检索任务 Associative Treecall(ATR),结合因果干预分析 Transformers 与状态空间模型(SSMs)的内部机制。主要贡献是说明相似的任务准确率不必意味着相同的信息存储与检索方式。 作者报告,在其 AR 实验设置中,只有 Transformers 和 Based 完全成功,Mamba 与 DeltaNet 接近成功,而 H3、Hyena 未能成功;摘要未提供具体准确率、数据规模或划分。机制分析表明,Transformers 与 Based 通过归纳机制(induction)在上下文中存储键—值关联;相比之下,其他受分析的 SSMs 似乎主要通过单层在最后状态计算这些关联。作者进一步报告,Mamba 确实能实现归纳机制,但该机制来自短卷积,而非 SSM 本身。 在 ATR 上,作者报告各架构延续了其在 AR 上学习到的机制;移除短卷积后,Mamba 可以在 ATR 上学习类似 Attention 的归纳机制。这一结果提示,组件贡献与任务结构需结合考察,不能仅凭最终准确率判断架构是否学会了同一种算法。因果干预的具体操作、模型配置、训练条件、对照公平性、消融及统计信息尚未验证。 平台推测(待验证):这些机制分析可能帮助研究 EEG 长序列中早期事件与后续查询之间的关联检索,但原任务依赖可识别的键—值及层级结构,不等同于连续、低信噪比的 EEG 解码。可复用的是因果干预与组件消融思路;需改造的是信号编码、事件定义及检索监督。一个可检验的小实验是在固定被试内划分和相同训练预算下,比较保留或移除短卷积的 Mamba 对事件关联检索的表现,再干预对应历史片段检验依赖路径。噪声、通道差异及小数据可能使模型学习局部线索而非长程关联;跨被试有效性需另行评估,已有 EEG 相关工作尚未检索确认。
该研究通过因果干预区分检索准确率相近架构的内部机制,尤其值得核对 Mamba 中短卷积与 SSM 对归纳机制的不同贡献,但其对 EEG 长程信息检索的意义尚未验证。
来源:OpenReview · State space models · openreview.net