跳到正文
OpenReview · State space models· Zhihao Zhan; Jianan Zhao; Zhaocheng Zhu; Jian Tang·· 2025-09-19精选AI 评分80

通过上下文依赖稀疏注意力克服状态空间模型的长上下文局限

Overcoming Long Context Limitations of State Space Models via Context Dependent Sparse Attention

AI 导读

基于摘要分析。本文主要研究自然语言处理中的长上下文建模:针对状态空间模型(SSMs)难以有效捕获长程依赖的问题,提出 joint recall 合成任务,并以 Context-Dependent Sparse Attention(CDSA)增强 SSMs,进一步提出面向自然语言的 HAX 实现。 任务与理论:传统 associative recall 要求根据单个 key 回忆对应 value,不涉及上下文;joint recall 则要求在指定上下文中检索 key 对应的 value。作者认为后者更能刻画真实长上下文建模的复杂性。作者报告,理论分析证明 SSMs 无法在次二次时间复杂度下解决 multi-query joint recall,而结合 CDSA 的方案具有在次二次计算下解决该任务的表达能力。该结论涉及的 SSM 定义、任务假设与证明边界,需结合全文核对,不能据此泛化为所有 SSM 在所有长序列任务中均存在同样限制。 方法与证据:HAX 即 locality-sensitive Hashing Attention with sparse Key Selection,是上述理论方案的具体实现,并针对自然语言领域作了调整。摘要未给出哈希、key 选择、训练目标或推理过程的细节。作者报告,在合成任务及真实长上下文基准上,HAX 持续优于 SSM 基线和结合 Context-Independent Sparse Attention(CISA)的 SSMs;具体数据集、数据划分、指标、增益幅度、计算开销、消融及统计信息尚未验证。摘要提供了代码地址,但代码完整性与复现条件尚未核对。 平台推测(待验证):迁移假设是,若 EEG 长序列任务确实需要按当前上下文检索远处相关片段,CDSA 的机制可能补充 SSM 的长程信息访问能力。可考虑复用 SSM 与稀疏注意力的组合,但需重新定义 EEG 片段表示、上下文和 key 选择规则;自然语言中的检索结构与监督条件不能直接视为 EEG 中已存在。低信噪比可能使哈希或稀疏选择漏掉有效片段,跨被试差异、通道变化及小数据也可能削弱检索稳定性。一个可检验的小实验是在固定 EEG 任务与相同被试划分下,以匹配训练预算比较 SSM、SSM+CISA 和 CDSA 类方案,考察序列长度增加时任务指标与计算开销的变化。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其以 joint recall 刻画上下文相关检索需求、并结合表达能力分析设计 CDSA 与 HAX 的方法路径,但理论适用条件和实验优势尚需全文核对,EEG/BCI 迁移效果尚未验证。

来源:OpenReview · State space models · openreview.net