跳到正文
OpenReview · State space models· Georgios Pantazopoulos; Malvina Nikandrou; Ioannis Konstas; Alessandro Suglia·· 2026-07-06精选AI 评分74

Retrievit:Transformers、状态空间模型与混合架构的上下文检索能力

Retrievit: In-context Retrieval Capabilities of Transformers, State Space Models, and Hybrid Architectures

AI 导读

基于摘要分析。该研究针对 Transformers 的上下文检索能力与序列长度二次复杂度、状态空间模型(SSMs)的线性时间处理与有限检索能力之间的权衡,比较两类模型及其混合架构,考察混合设计能否兼顾效率与精确检索。研究对象是合成序列中的上下文检索,并非 EEG 或 BCI。 研究设置两项任务:n-gram retrieval 要求定位查询之后的 n-gram 并复现;position retrieval 则以单个查询 token 为输入,先查找序列中的对应元素,再输出其位置索引,构成两跳关联查找。作者在受控条件下评估数据效率、长度泛化、对训练分布外样例的鲁棒性及学习到的表征。摘要未提供具体模型配置、训练规模、数据划分、量化指标或计算开销实测,实验协议、消融及统计信息尚未验证。 作者报告,在需要从输入上下文中精确检索信息的任务上,混合模型优于 SSMs,并在数据效率和外推能力上达到或超过 Transformers;但在 position retrieval 中,Transformers 仍占优势,不能将混合架构的收益概括为所有检索任务上的统一优势。作者还报告,基于 SSM 的模型形成局部性感知嵌入,相邻位置对应的 token 在嵌入空间中也相邻。作者将这一现象与 SSM 的增量式状态更新及无位置编码时需要自行学习位置关联联系起来;相较之下,作者认为 Transformers 的因果注意力足以学习位置关联,加入位置编码进一步改善数据效率。 平台推测(待验证):若 EEG 任务需要在长上下文中定位特定事件并关联其时序位置,该研究可为检索能力与状态压缩之间的权衡提供机制假设。可参考 Transformer、SSM 与混合架构的比较框架,但离散 token 的明确匹配监督需要改造为连续、多通道 EEG 的事件表征与位置监督;低信噪比、跨被试差异、通道变化及小数据可能破坏清晰的检索对应关系。一个可证伪的小实验是在固定被试内划分下,以已标注事件的片段匹配和位置定位为任务,对比三类架构在训练长度与更长测试序列上的表现,并匹配训练预算。原领域结果不等于 BCI 有效性,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其对上下文精确检索与位置关联学习的受控比较,尤其是混合架构的任务依赖性优势;这些结论能否迁移到 EEG 长序列建模尚未验证。

来源:OpenReview · State space models · openreview.net