Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
基于摘要分析。该研究面向文本、图像及语音的多模态预训练,提出 Mixture-of-Mamba(MoM):通过对 Mamba block 进行模态专属参数化,引入模态感知稀疏性,旨在利用不同模态的特征,同时保留状态空间模型(SSMs)的计算效率。 机制与对照:该方法沿用 Mixture-of-Transformers 的模态感知稀疏性思路,将其扩展至 SSMs。作者报告,投影组件的联合解耦比单独修改带来更大收益,提示不同组件之间可能存在协同作用;但具体解耦位置、参数共享方式、稀疏执行规则及参数量匹配条件尚未验证,不能将其直接等同于常规专家路由机制。 评估与结果:作者在三种预训练设置下评估:Transfusion 使用交错文本与连续图像 tokens,并包含扩散损失;Chameleon 使用交错文本与离散图像 tokens;第三种设置进一步纳入语音。作者报告,在 1.4B 规模的 Transfusion 设置中,达到等效图像损失所需训练 FLOPs 为对照的 34.76%;在同规模 Chameleon 设置中,达到相近图像损失和文本损失分别需要对照的 42.50% 和 65.40% FLOPs;在同规模三模态设置中,匹配语音损失需要对照的 24.80% FLOPs。这些数字衡量特定设置下的同损失训练计算成本,不代表生成质量或下游任务准确率的同等提升。具体对照配置、数据集、训练预算、损失匹配判据、消融及统计信息尚未验证。 平台推测(待验证):假设模态专属参数化也能缓解 EEG 与语音、图像等信号联合建模时的异质性,可复用的部分是按模态区分参数及投影组件解耦的思路;需改造信号编码、时间对齐和训练目标。该假设依赖可区分模态的序列输入及足够的多模态训练数据,低信噪比、跨被试差异、通道配置变化和小数据可能使专属参数过拟合。可用小规模 EEG—刺激联合建模,在固定数据划分、参数规模和训练 FLOPs 下比较共享与模态专属参数化,同时检查损失和下游任务指标。已有 EEG 相关工作尚未检索确认。
值得核对其模态专属参数化及投影组件联合解耦如何降低多模态预训练的同损失计算成本,但摘要中的效率结果不等同于下游任务或 EEG/BCI 有效性。
来源:OpenReview · State space models · openreview.net