Multimodal Mamba:通过从二次复杂度到线性复杂度的蒸馏构建仅解码器多模态状态空间模型
Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation
基于摘要分析。本文研究多模态大语言模型(MLLMs)因二次计算复杂度、不断增长的 Key-Value 缓存及独立视觉编码器依赖而面临的部署问题,提出 mmMamba,通过渐进蒸馏将已训练的仅解码器 MLLM 转换为线性复杂度的原生多模态状态空间模型。 核心方法包括从已训练 Transformer 构造 Mamba 的初始化策略,以及将 Transformer 知识迁移到 Mamba、同时保留多模态能力的三阶段蒸馏流程。作者称该转换不需要预训练的 RNN-based LLM 或视觉编码器,并可使用适度的学术计算资源完成;具体资源规模尚未验证。框架还支持混合 Transformer 与 Mamba 层,以调整效率和性能的权衡。初始化映射、各阶段训练目标、损失形式及层替换配置均需全文核对。 模型以 Transformer-based、仅解码器的 HoVLE 为蒸馏来源。作者报告,mmMamba-linear 相对已有线性及二次复杂度 VLMs 具有竞争力,mmMamba-hybrid 则进一步改善性能并接近 HoVLE,但摘要未给出任务、数据集和性能指标。在 103K tokens 条件下,相对 HoVLE,作者报告 mmMamba-linear 加速 20.6 倍、GPU 显存减少 75.8%;mmMamba-hybrid 加速 13.5 倍、显存减少 60.2%。硬件、精度、批量大小、计时范围及输入构成尚未验证,不能将这些结果直接推广到其他序列长度或部署条件。摘要提供了代码与模型发布链接,但可复现配置及权重内容尚未核验;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移机制是用已训练教师的知识初始化并蒸馏线性复杂度学生,可能对应长时程 EEG 建模的计算与存储瓶颈,而非已证实的 BCI 解码改进。迁移依赖具备相关能力的教师、合适的 EEG 序列表示及足够的蒸馏数据;可考察初始化和分阶段蒸馏流程,但信号输入适配、通道表示与任务监督需要改造。低信噪比、跨被试差异、通道变化及小数据可能使教师误差传递或局部判别信息丢失。一个可检验的小实验是在固定跨被试划分与相同输入长度下,对比 EEG Transformer 教师、蒸馏 Mamba 与直接训练 Mamba 的同一解码指标、延迟和显存,再检查序列变长后的变化。相关 EEG 工作尚未检索确认。
值得核对其将已训练 decoder-only MLLM 渐进蒸馏为 Mamba 的初始化与训练流程,以及超长序列下效率和多模态能力的权衡;摘要报告的加速尚不能直接外推为 EEG/BCI 收益。
来源:OpenReview · State space models · openreview.net