跳到正文
OpenReview · State space models· Weixin Liang; Junhong Shen; Genghan Zhang; Ning Dong; Mengjie Xie; Luke Zettlemoyer; Lili Yu·· 2025-09-20AI 评分78

Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity

AI 导读

基于摘要分析。研究针对状态空间模型(SSMs)在多模态预训练中利用模态特定特征能力受限的问题,提出 Mixture-of-Mamba,通过 Mamba block 的模态专属参数化引入模态感知稀疏性。核心贡献是探索这种设计能否以更少训练计算量达到相近的各模态损失,而非验证 EEG 或 BCI 任务效果。 作者在三类多模态预训练设置中评估该方法:Transfusion 使用交错文本与连续图像 token,并包含扩散损失;Chameleon 使用交错文本与离散图像 token;第三类扩展框架进一步纳入语音。摘要未说明具体参数分配、稀疏激活规则或完整损失组合。作者报告,投影组件联合解耦比单独修改带来更大收益,提示不同组件的模态专属化存在协同作用,但具体组件和消融数值尚未验证。 在摘要所述 1.4B 规模下,作者报告:Transfusion 设置达到等效图像损失所需训练 FLOPs 为对照的 34.76%;Chameleon 设置达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;三模态设置达到匹配语音损失所需 FLOPs 为对照的 24.80%。这些比例对应不同预训练设置和损失目标,不能直接横向比较,也不等于下游任务性能提升。对照模型配置、数据规模与划分、计算量核算、实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,在 EEG 与文本或其他信号联合建模时,模态专属参数化可能缓解共享序列模型对不同输入统计特征的混合处理问题。可复用的是 Mamba 序列建模及参数解耦思路;需要改造 EEG 输入编码、模态标识和训练目标,并依赖可用的多模态配对或交错序列数据。低信噪比、通道差异、跨被试分布变化及小数据可能使专属参数过拟合,原文大规模预训练收益不保证迁移成立。可在固定 EEG—文本数据划分下,以同等训练 FLOPs 比较共享参数 Mamba 与模态专属版本,并分别检查预训练损失和跨被试任务指标;相关 EEG 工作尚未检索确认。

来源:OpenReview · State space models · openreview.net