跳到正文
OpenReview · State space models·· 22 天前精选AI 评分81

State Space Attention:学习上下文依赖的记忆保留

State Space Attention: Learning Context-Dependent Memory Retention

AI 导读

基于摘要分析。本文研究标准注意力的 key–value cache 随上下文长度线性增长时,序列模型如何学习保留有用历史信息。作者提出 State Space Attention(SSA),以有界历史表征集合承担记忆,并使用标准注意力读取,核心贡献是让记忆保留决策随新上下文与当前记忆内容动态变化。 机制上,学习式评分器在新上下文到来时,结合记忆中的其他内容反复对所有片段重新评分。评分器与读取器联合训练,训练过程从完全可微的候选记忆软加权逐渐过渡到硬性保留固定数量的记忆。评分器还获得一种反馈:原本会被丢弃的信息若得到保留,是否能够改善模型预测。摘要未给出该反馈的具体计算方式、损失形式或软硬选择转换细节,尚不能据此还原实现。 作者报告,在其评估的检索与推理基准上,SSA 保持与全注意力 Transformer 相当的性能,同时活跃推理记忆不随序列长度增长。比较对象包括循环模型、有界记忆注意力方法和全注意力 Transformer,任务涵盖检索、变量追踪、多跳推理及语言建模。作者还预训练了参数规模为 400M 的模型,训练语料量为 15B tokens,并评估计算成本、记忆成本与语言建模表现;摘要未提供具体分数、基准名称和成本数值。活跃推理记忆有界并不直接说明总计算成本或延迟恒定,仍需核对重评分及候选片段处理方式。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将长时 EEG 组织为连续片段,SSA 的记忆评分与读取机制可能用于在固定容量下保留跨片段任务线索,对应长记录建模的存储瓶颈。但原研究对象是通用序列建模,相关 EEG 工作尚未检索确认。迁移假设依赖可训练的片段表征及任务预测监督,需要改造信号编码、时间位置表示和训练目标;低信噪比、跨被试差异、通道变化及小数据可能使评分器保留伪迹或丢弃稀疏有效事件。可在固定数据划分、相同 EEG 编码器和相同记忆容量下,小规模比较学习式保留与滑动窗口保留,检验延长输入后任务表现与活跃记忆用量是否支持这一假设。

阅读价值

值得核对其上下文依赖的记忆重评分与保留决策训练机制,尤其是固定容量记忆能否保留多跳推理所需信息;摘要中的性能结论仍需结合具体基准与计算成本验证。

来源:OpenReview · State space models · openreview.net