跳到正文
OpenReview · State space models·· 2026-01-09精选AI 评分77

Mixture-of-Mamba:通过模态感知稀疏性增强多模态状态空间模型

Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity

AI 导读

基于摘要分析。本文针对状态空间模型(SSMs)在多模态预训练中难以充分利用模态特定特征的问题,提出 Mixture-of-Mamba,通过对 Mamba block 进行模态特定参数化引入模态感知稀疏性。主要研究对象是文本、图像及语音的多模态预训练,而非 EEG 或 BCI。 作者在三种设置中评估该架构:Transfusion 使用交错的文本与连续图像 token,并包含扩散损失;Chameleon 使用交错的文本与离散图像 token;第三种设置进一步加入语音。摘要未给出具体参数分配、稀疏激活规则及完整训练目标,因此不能将其直接等同于某种已知专家路由方案。 作者报告,在 1.4B 规模的 Transfusion 设置下,达到等效图像损失所需训练 FLOPs 为对照的 34.76%;在同规模 Chameleon 设置下,达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;在同规模三模态设置下,匹配语音损失所需 FLOPs 为对照的 24.80%。这些数字衡量达到相近预训练损失的计算开销,不代表下游任务准确率或推理速度提升。具体对照配置、数据集、划分、FLOPs 核算口径及统计信息尚未验证。作者还报告,投影组件联合解耦比单独修改产生更大收益,但消融细节尚未验证。 平台推测(待验证):若 EEG 与文本或其他信号能够组成带明确模态标识的序列,模态特定参数化可能用于缓解共享序列模型对不同信号统计特性的处理冲突。可借鉴的是按模态分配参数的设计;需改造 EEG token 化、时间对齐及训练目标。原研究依赖多模态预训练,具体数据规模尚未验证;EEG 的低信噪比、通道差异、跨被试分布变化及小数据条件可能使参数解耦增加过拟合,而非带来计算收益。一个可检验的小实验是在固定 EEG—文本数据、训练预算及 Cross-subject 划分下,对比共享 Mamba 与模态特定参数化版本,记录达到相同验证损失的 FLOPs 及下游任务表现。相关 EEG 工作尚未检索确认。

阅读价值

值得核对其模态特定参数化与投影组件联合解耦是否真正降低达到相同损失所需的训练计算量,但摘要结果尚不能证明其对 EEG/BCI 多模态建模有效。

来源:OpenReview · State space models · openreview.net