Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
基于摘要分析。本文研究文本、图像及语音的多模态预训练,提出 Mixture-of-Mamba,通过对 Mamba block 进行模态专属参数化,引入模态感知稀疏性,旨在利用不同模态的特征,同时保持状态空间模型(SSMs)的计算效率;研究并非 EEG 或 BCI 验证。 核心机制:作者将 Mixture-of-Transformers 的模态感知稀疏设计扩展至 SSMs,并研究投影组件解耦。作者报告,联合解耦比单独修改产生更大收益。摘要未说明具体解耦哪些投影、参数共享边界及稀疏计算的实现方式,不能据此将其解释为已明确的专家路由机制。 评估与结果:实验涵盖 Transfusion(交错文本与连续图像 token,包含扩散损失)、Chameleon(交错文本与离散图像 token)及加入语音的三模态框架。在 1.4B 规模下,作者报告:Transfusion 达到等效图像损失所需训练 FLOPs 为对照的 34.76%;Chameleon 达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;三模态设置匹配语音损失所需 FLOPs 为对照的 24.80%。这些数字对应各自设置中的损失匹配,不代表下游任务准确率,也不能直接跨设置比较。具体对照配置、数据集、训练预算、损失匹配标准及统计信息尚未验证。 平台推测(待验证):其可迁移假设是,模态专属参数化可能缓解 EEG 与文本、音频联合建模时的表征冲突;这一机制依赖可靠的模态标识及多模态训练数据。可考虑复用 SSM 序列建模模块和模态参数分离思路,但 EEG 的连续信号编码、通道组织和时间对齐需改造。低信噪比、跨被试差异、通道配置变化及小数据可能使专属参数过拟合。一个可检验的小实验是在同一配对 EEG—文本数据及固定跨被试划分下,对比共享参数 Mamba 与模态专属版本,统一训练预算,检验下游任务表现及损失匹配所需 FLOPs,并比较单独与联合解耦。此方案不是原论文结果,已有 EEG 相关工作尚未检索确认。 复现前需核对全文中的参数化细节、数据划分、FLOPs 计量范围和消融协议;代码与权重可用性尚未验证。
值得核对其模态专属参数化及投影组件解耦如何降低多模态预训练成本;摘要给出了不同模态损失下的训练 FLOPs 对比,但对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net