B'MOJO:具有精确记忆与衰减记忆的基础模型混合状态空间实现
B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory
基于摘要分析。该研究面向通用序列模型的直推式推理(transductive inference),关注如何在有限推理资源下,让记忆容量增长至有限但预先未知的上限。作者提出 B'MOJO 架构族,以随机实现理论(Stochastic Realization Theory)为基础,在可组合模块中融合并调节精确记忆(eidetic memory)与衰减记忆(fading memory)。 机制上,摘要将 Transformer 的有限上下文视为精确记忆,将 SSM 的状态视为覆盖长历史但逐渐衰减的记忆。B'MOJO 进一步区分上下文中的短期精确记忆、权重中的永久结构记忆、状态中的衰减记忆,以及存储中的长期精确记忆,并原生纳入对异步更新记忆的检索。作者称 Transformer、Mamba 和 Jamba 均可视为其特例,并描述了可堆叠、可在硬件上高效扩展的基础实现;具体状态更新、记忆调节与检索规则尚未验证。 作者报告,在 associative recall 等直推式推理任务上,B'MOJO 优于所比较的 SSM 和混合模型,但摘要未给出具体分数与完整基线配置。在常规语言建模中,对最高 1.4B 参数规模、相近大小模型的比较显示,其 perplexity 与 Transformer 和 SSM 相当,训练速度最高快 10%;这一速度结果的硬件、吞吐量口径及训练配置尚未验证。作者还报告,仅使用最长 8K tokens 的有界序列训练后,模型在最长 32K tokens、即训练最大长度四倍的序列上表现出更好的推理能力;具体数据集、划分、对照结果、消融及统计信息尚未验证。 平台推测(待验证):精确记忆与衰减记忆的分工可能对应 EEG 长序列中“保留局部事件细节”与“汇总长期背景状态”的需求,但原文研究对象并非 EEG 或 BCI,已有 EEG 相关工作尚未检索确认。可复用的候选部分是混合记忆模块;输入编码、时间位置表示、通道组织及检索单元需要改造,且原方法对训练数据规模与监督形式的依赖尚未验证。低信噪比可能使精确记忆保留伪迹,跨被试与通道差异可能削弱检索匹配,小数据则可能不足以学习记忆调节。一个可检验的小实验是在固定数据划分、参数预算与输入编码下,对比纯 SSM 和 B'MOJO 类混合模块,测试训练窗口之外的更长 EEG 序列,并核对任务指标、推理开销与去除精确记忆后的变化;这仅是迁移假设,不是已证实的 BCI 效果。
值得阅读的是 B'MOJO 如何在可组合模块中调节精确记忆与衰减记忆,并检验超出训练序列长度的推理能力;其对 EEG 长序列建模的价值尚未验证。
来源:OpenReview · State space models · openreview.net