B'MOJO:具有精确保留记忆与衰减记忆的基础模型混合状态空间实现
B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory
基于摘要分析。该研究面向序列模型的转导推理,提出 B'MOJO 架构族,旨在有限推理资源下统一精确保留记忆(eidetic memory)与衰减记忆(fading memory),并允许记忆容量增长至有限但预先未知的上限。原论文主要研究通用序列建模、关联回忆与语言建模,并非 EEG 或 BCI。 机制上,作者借助 Stochastic Realization Theory,在可组合的基本模块内调节两类记忆。整体架构涵盖上下文中的短期精确保留记忆、权重中的永久结构记忆、状态中的衰减记忆,以及存储中的长期精确保留记忆;后者通过检索异步更新的记忆实现。作者称 Transformers、Mamba 等 SSMs 及 Jamba 等混合架构可作为 B'MOJO 的特例。摘要未提供具体状态更新方程、损失或检索策略,相关实现细节尚未验证。 作者报告,在关联回忆等转导推理任务上,B'MOJO 优于所比较的 SSMs 与混合模型,但摘要未列出数据规模及具体指标。在常规语言建模中,作者报告其在最高 1.4B 参数的模型比较范围内,困惑度与相近规模的 Transformers 和 SSMs 相当,训练速度最高快 10%;硬件、训练预算及计时口径尚未验证。作者还报告,在最长 32K tokens、为训练所见最长序列长度四倍的测试条件下,调节两类记忆可改善长序列推理,但具体增益与对照协议尚未验证。基本实现被描述为计划开源,不能据此认定代码已发布;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务同时依赖局部事件细节与较长时间尺度的背景状态,该混合记忆机制可能具有对应价值。可复用的是状态记忆与检索记忆的组合思路,需改造连续 EEG 的输入编码、时间位置表示及记忆更新策略;语言 token 上的效果不保证适用于低信噪比、通道差异或跨被试变化,小数据也可能不足以学到可靠的记忆调节。一个可证伪的小实验是在固定 EEG 数据划分、训练预算和输入编码下,比较纯 SSM 与混合记忆版本,并测试延长输入窗口是否带来稳定收益。已有 EEG 相关工作尚未检索确认。
值得核对 B'MOJO 如何统一精确保留与衰减记忆,以及关联回忆和长序列外推中的收益是否来自可调记忆机制;这些结果尚不能视为 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net