Samba:用于高效无限上下文语言建模的简单混合状态空间模型
Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling
基于摘要分析。本文研究语言模型在超长上下文下的计算效率与长度泛化问题,提出 Samba,通过逐层结合选择性状态空间模型 Mamba 与 Sliding Window Attention(SWA),兼顾历史信息压缩和近期信息的精确召回。主要研究对象是语言序列,并非 EEG 或 BCI。 机制上,Mamba 将序列选择性压缩为递归隐藏状态,SWA 则承担近期记忆的注意力访问。该组合旨在缓解全注意力的二次计算复杂度,同时改善仅依赖压缩状态时的信息召回。摘要将 Samba 描述为线性时间序列模型,但具体层间配置、窗口大小、状态容量、损失与训练细节尚未验证。 作者报告,将 Samba 扩展至 3.8B 参数并使用 3.2T 训练 tokens 后,在多项基准上优于所比较模型;摘要未给出逐项分数。以 4K 长度序列预训练时,作者报告零样本外推至最高 1M 上下文长度时困惑度有所改善,但具体比较参照尚未验证。以 4K 长度序列微调后,作者报告在 Passkey Retrieval 中外推至 256K 上下文仍实现完全记忆召回,并在 Phonebook 任务上表现出优于全注意力模型的检索外推能力。效率方面,作者报告在 128K 长度用户提示下,相比采用 grouped-query attention 的 Transformers,吞吐量为其 3.73 倍;在无限流式生成 64K tokens 的设置下,实现 3.64 倍加速。硬件、批量大小、精度、数据划分、对照配置、消融及统计信息尚未验证。 平台推测(待验证):递归状态压缩与局部精确访问的组合可能对应 EEG 长记录处理中的计算与局部时序保真瓶颈。可复用的是混合序列骨干;需改造连续信号输入、通道组织和任务输出,并重新设计训练目标。原研究依赖大规模语言 tokens 与语言建模、检索任务,不能假定在低信噪比、小数据或跨被试 EEG 上同样有效;状态压缩可能丢失短暂事件,局部注意力也可能不足以保留远距离弱信号。可检验的小实验是在固定数据划分与训练预算的 EEG 任务中,对比 Mamba、SWA 与混合骨干,在延长输入窗口时同时观察任务指标、吞吐量和显存占用。已有 EEG 相关工作尚未检索确认。
值得核对 Samba 将递归状态压缩与局部注意力结合后的长上下文外推及吞吐量表现,但其语言任务结果不能直接作为 EEG 长序列建模有效性的证据。
来源:OpenReview · State space models · openreview.net