PUM-Net:面向长上下文状态空间模型的双记忆检索
PUM-Net: Dual-Memory Retrieval for Long-Context State Space Models
基于摘要分析。PUM-Net 研究长上下文语言建模中递归状态压缩后无法显式重访已丢弃信息的问题,以 Mamba 为基础引入输入上下文记忆与离线语料记忆,旨在兼顾长序列计算效率、输入细节召回和相关语料知识利用。 机制上,内部检索访问已经完成的输入片段,外部检索访问离线编码的语料表示;两组检索结果通过双向注意力,利用另一来源的候选信息分别更新,再经池化与门控整合进入模型。该设计将递归计算、因果上下文保留和离线语料复用分开,不通过向输入追加检索段落来引入证据,并保留 Mamba 的并行扫描。具体检索索引、编码器、门控实现及训练目标尚未验证。 作者报告,在使用 4k-token 窗口微调后,启用语料记忆的配置在全部十二种领域—长度评估设置中取得最低困惑度,评估长度最高为 32k;摘要未给出领域名称、具体困惑度或完整对照清单。作者还报告,在 130M 规模、超过训练长度的二十种单次 passkey 测试设置中,内部检索成功恢复十八种设置的 passkey,Mamba 为十种。此结果应限定于该召回任务与单次测试协议,不能直接视为多次重复下的成功率。数据划分、语料重叠控制、消融及统计信息尚未验证。 平台推测(待验证):显式保留片段并按需检索,可能用于 EEG 长序列建模中被递归压缩弱化的局部证据,但原研究对象是语言,而非 EEG 或 BCI。该迁移假设需将 token 片段表示改造为 EEG 时段表示,并明确外部记忆的监督来源及被试隔离方式;低信噪比、通道差异与跨被试分布偏移可能使检索匹配失效。可在固定数据划分和相同训练预算下,先比较 Mamba 与仅增加内部片段记忆的版本,检验延长输入后是否改善任务表现,并设置随机检索对照。已有 EEG 相关工作尚未检索确认。
值得核对其如何在保留 Mamba 并行扫描的同时联合检索输入记忆与离线语料记忆,以及长上下文预测收益是否依赖外部语料配置;摘要中的单次 passkey 测试尚不足以确认结果稳定性。
来源:OpenReview · State space models · openreview.net