Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
基于摘要分析。本文研究文本、图像及语音的多模态预训练,针对状态空间模型(SSMs)难以充分利用模态特有特征的问题,提出 Mixture-of-Mamba(MoM):通过 Mamba block 的模态专属参数化引入模态感知稀疏性,将 Mixture-of-Transformers 的设计思路扩展到 SSMs,同时旨在保持计算效率。 评估包含三种设置:Transfusion 使用交错文本与连续图像 token,并包含扩散损失;Chameleon 使用交错文本与离散图像 token;第三种设置进一步加入语音。作者报告,在 1.4B 规模下,Transfusion 达到等效图像损失所需训练 FLOPs 为比较对象的 34.76%;Chameleon 达到相近图像损失和文本损失分别需要 42.50% 和 65.40% 的 FLOPs;三模态设置达到相匹配的语音损失需要 24.80% 的 FLOPs。这些数字对应特定预训练损失的计算量比较,不代表下游任务性能提升,摘要也未明确各项比较的具体基线与损失匹配判据。 作者报告,投影组件的联合解耦比单独修改产生更大收益,支持模态专属参数化存在协同效应。具体解耦位置、参数分配、稀疏计算实现、训练数据及其配比、完整实验协议和统计信息尚未验证;复现时需核对参数规模、训练预算与 FLOPs 计量是否可比。 平台推测(待验证):其可迁移机制是让不同模态使用专属参数,可能缓解 EEG 与其他信号联合建模时的表征干扰,但依赖明确的模态标识及可共同训练的数据。可复用的是模态感知参数化思路,需改造的是 EEG token 化、通道与时间对齐,以及训练目标。低信噪比、跨被试差异、通道不一致和小数据可能使专属参数过拟合,抵消计算收益。一个可检验的小实验是在具有配对 EEG 与另一模态的数据上,固定 Cross-subject 划分、参数规模及训练预算,比较共享参数 Mamba 与模态专属参数化版本的下游任务指标和训练 FLOPs。原文结果不构成 BCI 有效性的证据,已有 EEG 相关工作尚未检索确认。
值得阅读其模态专属参数化如何改善 SSM 多模态预训练的损失—计算量关系,尤其是投影组件联合解耦的消融结果;这些收益能否迁移至 EEG 多模态建模尚未验证。
来源:OpenReview · State space models · openreview.net