Mixture-of-Mamba:以模态感知稀疏性增强多模态状态空间模型
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
Mixture-of-Mamba 面向多模态序列预训练,针对状态空间模型(SSMs)难以充分利用模态特有特征的问题,在 Mamba block 中引入模态专属参数化,以模态感知稀疏性改善训练效率。基于摘要分析,未取得论文全文;研究对象是文本、图像及语音多模态建模,并非 EEG/BCI。 机制与对照:该方法沿用 Mixture-of-Transformers 的模态感知稀疏性思路,将其扩展到 SSMs。摘要指出,投影组件解耦具有协同效应,联合解耦优于单独修改;但具体解耦位置、参数共享方式、稀疏计算实现与参数量匹配条件尚未验证,不能据此认定其采用特定专家路由结构。 作者报告:在 1.4B 规模的 Transfusion 设置下,即文本与连续图像 token 交错、图像采用 diffusion loss 的预训练中,达到等同图像损失所需训练 FLOPs 为对照的 34.76%;在文本与离散图像 token 交错的 Chameleon 设置下,达到相近图像损失和文本损失所需 FLOPs 分别为对照的 42.50% 和 65.40%;在加入语音的三模态设置下,匹配语音损失所需 FLOPs 为对照的 24.80%。这些数字描述各自协议内的等损失计算成本,不代表下游任务性能提升,也不能跨设置直接比较。具体对照配置、数据集、训练划分、FLOPs 核算范围、消融细节及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 与文本或其他信号共同组成带明确模态标识的序列,模态专属投影可能缓解不同信号表征需求之间的冲突。可复用的是按模态区分参数的设计;需改造 EEG 编码、时间对齐与训练目标。原实验处于大规模多模态预训练,EEG 的低信噪比、通道差异、跨被试分布变化及小数据条件可能使专属参数过拟合。一个可检验的小实验是在固定数据、目标与参数预算下,对比共享投影和模态专属投影的 EEG—文本 SSM,以严格跨被试划分同时观察任务指标与计算成本。已有 EEG 相关工作尚未检索确认。
值得核对模态专属参数化能否在保持 SSM 计算效率的同时降低多模态预训练成本;摘要提供了等损失下的 FLOPs 对照,但其对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net