Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
基于摘要分析。研究针对状态空间模型(SSMs)在多模态预训练中利用模态专属特征的能力受限问题,提出 Mixture-of-Mamba(MoM):通过 Mamba 模块的模态专属参数化引入模态感知稀疏性,在保留 SSM 计算效率的同时改善训练效率。主要研究对象是文本、图像与语音多模态预训练,并非 EEG 或 BCI。 机制上,该方法将 Mixture-of-Transformers 的模态感知稀疏设计扩展到 SSMs。作者报告,投影组件的联合解耦比单独修改带来更大收益,提示不同组件之间存在协同作用。具体解耦位置、参数共享方式、稀疏执行机制及参数量匹配条件尚未验证,不能据摘要将其等同于常规专家路由架构。 作者报告,在 1.4B 规模的 Transfusion 设置中,输入为交错文本与连续图像 token,并使用扩散损失,MoM 达到等效图像损失所需训练 FLOPs 为比较对象的 34.76%;在交错文本与离散图像 token 的 Chameleon 设置中,达到相近图像损失和文本损失分别需要 42.50% 和 65.40% 的 FLOPs;在加入语音的三模态设置中,匹配语音损失需要 24.80% 的 FLOPs。摘要未明确比较对象及完整训练预算,相关基线、数据划分与统计信息尚未验证。这些指标衡量达到相近预训练损失的计算成本,不等于下游准确率、推理加速或实际运行时间收益。 平台推测(待验证):若 EEG 与其他同步模态存在不同的输入统计和表征需求,模态专属参数化可能缓解完全共享模型中的模态干扰。可复用的是 SSM 序列建模与参数解耦思路;需改造信号分段、输入表征、跨模态对齐和训练目标。原方法依赖多模态 token 序列与大规模预训练,迁移到低信噪比、小数据 EEG 时,专属参数可能过拟合,跨被试及通道差异也可能削弱收益。一个可证伪的小实验是在同步 EEG 与另一模态的数据上,固定数据划分和训练预算,对照共享 Mamba 与模态专属参数化版本,分别检查预训练损失和跨被试下游表现,并核对参数量与 FLOPs。已有 EEG 相关工作尚未检索确认。
值得核对模态专属 Mamba 参数化如何降低多模态预训练中达到相近损失的计算成本,以及投影组件联合解耦的消融证据;这些结果尚不能证明 EEG/BCI 下游任务收益。
来源:OpenReview · State space models · openreview.net