注意力与状态空间模型在 In-Context Learning 中的比较分析
A Comparative Analysis of Attention versus State-Space Models for In-Context Learning
基于摘要分析。本文研究 attention 与状态空间模型(SSMs)在 In-Context Learning 中的表征能力差异,提出统一分析框架 belief geometry,试图突破既有比较主要依赖经验实验、理论结论受特定任务或架构限制的问题。 研究从广义上下文线性回归出发,以累积 Bayes regret 为衡量标准,将序列学习所需能力抽象为证据组装、信念维持和寻址,并通过三个情形分别考察这些能力。作者报告:在平稳聚合核条件下,SSMs 在信念维持方面达到最优 regret;在按位置组装证据的情形下,SSMs 具有记忆优势;在按内容寻址的情形下,softmax attention 相对于 sigmoid-selective SSMs 具有指数级的宽度优势。这些结论各自依赖相应任务和模型类别,不能直接解释为某类架构在所有序列问题上更优。 作者报告,LLaMA-type Transformers 与 Mamba-2 的实验表明,上述架构洞见可延伸到理论可分析类别及线性回归测试场景之外。摘要未提供具体任务、数据划分、模型规模、基线配置或数值结果;理论假设、实验协议、消融及统计信息尚未验证,复现仍需全文中的任务生成与评估细节。 平台推测(待验证):若 EEG 任务能明确区分固定位置的证据聚合与按内容检索历史片段,该框架可能帮助分析有限记忆下的架构取舍。可复用的是能力分解和受控任务设计,需改造的是 EEG 表征、监督目标及评估指标;原文的上下文线性回归设定不能直接代表 EEG 解码。低信噪比、跨被试差异、通道变化及小数据可能削弱这种对应关系。可在固定 EEG 数据划分和相近资源预算下,分别构造位置聚合与内容检索任务,比较 attention 与 SSMs 的性能及记忆开销,检验优势是否随任务机制改变。已有 EEG 相关工作尚未检索确认。
该研究用统一理论框架区分证据组装、信念维持与寻址,为理解 attention 与 SSMs 在不同序列任务中的架构取舍提供具体依据,但其 EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net