Transformers 是 SSMs:通过结构化状态空间对偶构建广义模型与高效算法
Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
基于摘要分析。本文主要研究语言建模中的架构与计算效率问题,通过结构化半可分矩阵的不同分解,建立 SSM 与注意力变体之间的理论联系,提出状态空间对偶(SSD)框架,并据此设计 Mamba-2。 核心机制是以结构化半可分矩阵作为连接不同序列计算形式的数学桥梁,而非仅比较两类模型的预测性能。摘要明确将理论联系限定于 SSM 与注意力变体,因此不宜仅凭标题推断所有 Transformer 组件都与 SSM 完全等价。Mamba-2 的核心层是对 Mamba 选择性 SSM 的改进;具体参数化、训练目标、矩阵分解与计算实现尚未验证。 作者报告,Mamba-2 的核心层相较于 Mamba 的选择性 SSM 快 2–8 倍,同时在语言建模上保持与 Transformers 的竞争力。该倍数描述的是核心层速度,不能直接视为端到端训练或推理加速。摘要未提供对应硬件、序列长度、精度、模型规模、数据集及性能指标;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务依赖较长时间序列中的信息整合,SSD 支持的序列计算机制可能提供计算效率方面的候选方案,但语言建模结果不等于 BCI 有效性。可复用候选是 Mamba-2 的序列处理核心;输入表征、通道间关系建模及任务输出需针对 EEG 改造。低信噪比、跨被试差异、通道配置变化和小数据可能削弱收益。一个可检验的小实验是在固定 EEG 数据划分、预处理和训练预算下,与 Mamba 及注意力基线比较任务指标、运行时间和显存占用,并分别报告被试内与跨被试结果。已有 EEG 相关工作尚未检索确认。
SSD 为理解 SSM 与注意力变体的联系及设计高效序列模型提供了可核对的理论路径,但 Mamba-2 的速度收益需结合具体实现与测量协议验证,EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net