跳到正文
OpenReview · State space models· Shenran Wang; Timothy Tin-Long Tse; Jian Zhu·· 2025-01-01精选AI 评分75

理解 Transformers 之外的上下文学习:状态空间与混合架构研究

Understanding In-Context Learning Beyond Transformers: An Investigation of State Space and Hybrid Architectures

AI 导读

基于摘要分析。本文研究 Transformer、状态空间及混合架构的大语言模型如何完成上下文学习(ICL),在两类知识型 ICL 任务上结合行为探测与干预分析,考察相近的任务表现是否对应相同的内部机制。主要贡献是区分架构与任务类型对 ICL 机制的影响,而非提出 EEG/BCI 方法。 作者报告,不同架构的模型可能呈现相似的任务表现,但其内部机制仍有差异;与 ICL 相关的 function vectors(FVs,功能向量)主要位于自注意力层与 Mamba 层。对于 Mamba2,作者推测其可能通过不同于 FVs 的机制完成 ICL,这一表述属于机制假说,不宜视为已证实结论。作者还报告,FVs 对涉及参数化知识检索的 ICL 更重要,而对上下文知识理解的重要性较低;该结果应限定在本文考察的知识型任务范围内。 方法上的阅读价值在于联合使用行为与机制证据:前者考察模型完成任务的表现,后者通过干预分析内部表征与任务行为的关系。摘要未提供具体模型清单、任务或数据集名称、FVs 提取与干预流程、评估划分及量化结果,因此无法核对结论的效应大小和适用边界;实验协议、消融及统计信息尚未验证,复现所需实现与资源条件也尚未验证。 本文主要研究语言模型中的知识型 ICL。现有材料未建立该机制与 EEG 的信号结构、监督条件或任务瓶颈之间的具体对应关系,因此不据此生成 BCI 迁移效果或复现实验建议;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的具体原因是通过行为探测与干预分析区分不同架构的 ICL 内部机制,提示任务表现相近不等于机制相同;其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net