跳到正文
OpenReview · State space models· Zhihao Zhan; Jianan Zhao; Zhaocheng Zhu; Jian Tang·· 2025-06-12精选AI 评分80

通过上下文依赖稀疏注意力克服状态空间模型的长上下文局限

Overcoming Long-Context Limitations of State-Space Models via Context-Dependent Sparse Attention

AI 导读

基于摘要分析。本文主要研究 NLP 中状态空间模型(SSMs)的长上下文建模能力,提出上下文依赖的合成检索任务 joint recall,并将 SSMs 与 Context-Dependent Sparse Attention(CDSA)结合,以改善长程依赖检索。作者进一步提出 locality-sensitive Hashing Attention with sparse Key Selection(HAX),将理论方案具体化并面向自然语言任务调整。 问题与机制:传统 associative recall 要求根据单个 key 找回对应 value,不依赖上下文;joint recall 则要求在指定上下文中找回 key 对应的 value。作者认为后者更能反映真实长上下文建模的复杂性。作者报告,其理论证明表明 SSMs 无法以次二次时间复杂度解决 multi-query joint recall,而结合 CDSA 的方案具备以次二次计算解决该任务的表达能力。该结论适用的 SSM 定义、任务设定及证明条件尚未验证,不宜外推为所有 SSM 在所有长序列任务上的普遍限制。 实验与复现:作者报告,在合成任务及真实长上下文基准上,HAX 持续优于 SSM 基线和结合 context-independent sparse attention(CISA)的 SSM。摘要未提供基准名称、模型规模、序列长度、指标数值或计算开销;实验协议、消融及统计信息尚未验证。复现需核对 joint recall 的生成与划分规则、上下文如何参与稀疏 key 选择,以及各基线的训练预算、检索效果与实际时间和内存开销。 平台推测(待验证):其可迁移假设是,上下文依赖的稀疏检索可能帮助长时 EEG 建模保留与当前任务有关的远距离片段,但自然语言的 key–value 结构不等同于连续、低信噪比的 EEG。可复用部分是 SSM 与上下文依赖稀疏注意力的组合思路;需改造 EEG 分段表征、上下文定义和检索监督。噪声、跨被试变化、通道差异及小数据可能使稀疏选择误丢关键片段。一个小规模检验是在固定 Cross-subject 划分、相同训练预算下,对比纯 SSM、SSM+CISA 与 EEG 适配的 HAX,考察预先定义的长时依赖任务表现及时间、内存开销。已有 EEG 相关工作尚未检索确认,该实验建议并非本文已验证的 BCI 结果。

阅读价值

值得阅读的是其用 joint recall 区分无上下文检索与上下文依赖检索,并以理论表达能力分析连接稀疏注意力设计;具体理论条件、效率收益及向 EEG 的迁移价值尚待验证。

来源:OpenReview · State space models · openreview.net