Mamba:基于选择性状态空间的线性时间序列建模
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Mamba 针对长序列模型计算效率与内容依赖推理能力之间的矛盾,通过输入依赖的选择性状态空间模型(SSM)构建不含注意力和 MLP 模块的序列建模架构。基于摘要分析,原论文主要研究语言、音频和基因组学等模态,并非 EEG 或 BCI 方法。 核心机制是让 SSM 参数成为输入的函数,使模型根据当前 token 沿序列维度选择性传播或遗忘信息。作者认为,这可缓解既有次二次时间架构在离散模态上缺乏内容依赖推理能力的问题。由于输入依赖参数使原有高效卷积计算不再适用,作者设计了硬件感知的递归模式并行算法,并将选择性 SSM 整合进 Mamba。具体参数化、训练目标与实现细节尚未验证。 作者报告,Mamba 的计算随序列长度线性扩展,推理吞吐量为 Transformer 的 5 倍,并在真实数据上观察到性能随序列长度增加而改善,最长涉及百万长度序列;摘要未提供该吞吐量比较的硬件、批量、序列长度及基线配置,不能据此推断任意部署条件下的加速效果。在语言建模的预训练及下游评估中,作者报告 Mamba-1.4B 超过同规模 Transformer,并匹配两倍规模的 Transformer。作者还报告其在语言、音频和基因组学等模态达到当时最先进表现,但数据集、具体指标、实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务需要从长时间序列中保留任务相关片段并抑制无关信息,输入依赖的状态更新可能提供可复用机制。可复用部分是选择性 SSM 与长序列计算框架;需改造 EEG 输入表示、通道融合及任务输出。低信噪比可能使选择机制追随伪迹,跨被试差异和小数据训练也可能削弱效果。一个可检验的小实验是在固定数据划分、预处理与训练预算下,比较选择性 SSM、非选择性 SSM 和 Transformer 的任务指标、吞吐量及显存占用,并检查噪声扰动下的稳定性。已有 EEG 相关工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。
值得阅读其输入依赖的选择性状态空间机制与硬件感知递归计算设计,以评估长序列建模的效率—性能取舍;其对 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net