Transformer 与状态空间模型的机制评估
Mechanistic Evaluation of Transformers and State-Space Models
基于摘要分析。本文研究用于语言建模的 Transformer 与状态空间模型(SSMs)为何在上下文信息回忆任务上表现不同,核心贡献是结合合成任务与因果干预,区分行为指标相近的架构所采用的内部机制,并提出具有语言式层级结构的 Associative Treecall(ATR)任务。 在 Associative Recall(AR)实验中,作者报告只有 Transformer 和 Based SSM 完全成功,Mamba 表现接近,而 H3、Hyena 未能成功。摘要未提供具体 Accuracy、任务规模或数据划分,因此这些结论仅适用于文中所述合成任务,不能扩展为通用语言建模能力排名。 机制分析方面,作者报告 Transformer 与 Based 通过 induction heads 在上下文中存储键—值关联;相比之下,其他受测 SSM 仅在最后一个状态计算这些关联,其中 Mamba 的成功与其短卷积组件有关。摘要未交代因果干预的具体位置、操作与对照,相关机制结论的证据强度仍需结合全文核对。 ATR 基于 PCFG(概率上下文无关文法)归纳,在 AR 设置中加入语言式层级结构。作者报告,各架构在 ATR 上沿用其在 AR 中学到的机制,且仍是 Transformer、Based 与 Mamba 成功。这支持作者的主要判断:相近的任务准确率不代表相同的内部计算机制,架构评估应结合机制证据。训练配置、实验协议、消融及统计信息尚未验证。 平台推测(待验证):该研究的因果干预评估思路可用于检验 EEG 序列模型是否真正保留跨时间关联,但原任务依赖明确的键—值关系和合成层级结构,与连续、低信噪比的 EEG 不同。可复用的是受控任务与干预框架,需改造的是信号表示和关联监督;被试差异、通道变化及小数据可能使机制难以稳定辨识。一个可证伪的小实验是在固定被试内划分下,对包含可控延迟线索的 EEG 片段比较 Transformer 与 SSM,并干预相关时间片段或内部状态,检验任务表现与延迟关联依赖是否一致;不能将原论文结果视为 BCI 有效性的证据,已有 EEG 相关工作尚未检索确认。
值得阅读的具体原因是通过因果干预比较相近任务表现背后的不同信息存储机制,并用具有层级结构的 ATR 检验机制是否延续;其对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net