Mamba-3:利用状态空间原理改进序列建模
Mamba-3: Improved Sequence Modeling using State Space Principles
基于摘要分析。该研究面向 LLM 推理中模型质量与计算、内存效率的权衡,提出 Mamba-3,以状态空间模型(SSM)原理改进线性序列模型的表达能力、状态跟踪与实际推理效率;主要研究对象是语言序列建模,而非 EEG 或 BCI。 方法包括三项核心改进:由 SSM 离散化导出的更具表达力的递推机制、支持更丰富状态跟踪的复数状态更新规则,以及多输入多输出(MIMO)形式。作者称,MIMO 能改善模型表现而不增加解码延迟,并结合其他架构调整提升检索、状态跟踪及下游语言建模能力。摘要未提供具体离散化公式、复数状态实现、训练目标或架构细节,尚不能据此确定各模块的独立贡献。 作者报告,在 1.5B 模型规模的下游任务评估中,Mamba-3 的平均 Accuracy 比次优模型 Gated DeltaNet 高 0.6 个百分点;MIMO 变体进一步提高 1.2 个百分点,合计提高 1.8 个百分点。在状态大小对比实验中,作者报告 Mamba-3 使用 Mamba-2 一半的状态大小即可获得相近困惑度。具体任务集合、数据划分、基线训练条件、延迟测试硬件与统计信息尚未验证;困惑度相近也不能直接解释为所有任务能力等价。 平台推测(待验证):若其递推状态能保留连续信号中的任务相关历史,可能有助于 EEG 长序列或流式解码。可考虑复用递推与状态更新机制,但需将语言输入改造成多通道 EEG 表征,并重新设计监督任务和输出头;MIMO 在原文中的含义不能直接等同于 EEG 多通道输入。低信噪比、通道变化、跨被试分布差异及小数据训练可能使语言任务中的收益无法迁移。一个可检验的小实验是在固定 EEG 数据划分、输入窗口与训练预算下,对比 Mamba-2 和 Mamba-3 的任务指标、流式延迟及状态内存,并分别核对复数更新和 MIMO 的贡献。已有 EEG 相关工作尚未检索确认,复现所需代码、权重与完整实验协议也尚未验证。
值得核对其 SSM 离散化、复数状态更新与 MIMO 对状态跟踪能力及解码效率的分别贡献,但摘要中的语言建模收益尚不能作为 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net