B'MOJO:兼具精确保留记忆与衰减记忆的基础模型混合状态空间实现
B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory
基于摘要分析。本文研究通用序列模型如何在有限推理资源下支持转导推理,使记忆容量增长至有限但事先未知的上界。作者提出 B'MOJO,借助 Stochastic Realization Theory,在可组合模块中协调精确保留记忆(eidetic memory)与衰减记忆(fading memory),主要研究对象是序列架构、关联回忆及语言建模,而非 EEG 或 BCI。 机制上,作者将 Transformer 的有限上下文精确保留与 SSM 的跨长序列衰减状态统一描述,并区分四类记忆:上下文中的短期精确保留记忆、权重中的永久结构记忆、状态中的衰减记忆,以及存储中的长期精确保留记忆。后者通过原生接入异步更新记忆的检索实现。作者称 Transformer、Mamba 和 Jamba 均可视为 B'MOJO 的特例,并给出可堆叠、可高效硬件扩展的基础实现;具体状态更新、记忆调节与检索规则尚未验证。 作者报告,在关联回忆等转导推理任务中,B'MOJO 优于所比较的 SSM 与混合模型,但摘要未提供具体分数和基线配置。在普通语言建模评估中,模型规模最高达 1.4B 参数,与相近规模 Transformer 和 SSM 的困惑度相当,训练速度最高快 10%;硬件、吞吐量口径与训练配置尚未验证。作者还报告,在训练序列最长为 8K tokens 的条件下,模型在最长 32K tokens、即训练最大长度四倍的序列上取得更好的长序列推理表现;摘要未给出该结果的具体指标。数据集、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务同时依赖局部瞬态模式和长程上下文,这种混合记忆机制可能提供可检验的建模路径。可复用候选是记忆组合模块,需改造信号输入表示、位置或时间编码及检索单元,并配套 EEG 数据与任务监督;低信噪比可能使长期存储保留伪迹,跨被试差异、通道变化和小数据规模也可能削弱记忆的可用性。一个小规模实验是假设检验:固定 EEG 划分、参数规模和训练长度,对比 SSM 与混合记忆模型在更长测试片段上的任务表现,并加入伪迹扰动,检验收益是否稳定而非噪声累积。已有 EEG 相关工作尚未检索确认。
值得关注其在同一模块内协调精确保留与衰减记忆、并接入异步检索的机制,以及受限训练长度下的长序列推理评估;这些机制能否改善 EEG 长时序建模尚未验证。
来源:OpenReview · State space models · openreview.net