跳到正文
OpenReview · State space models· Zheng Zhan; Liliang Ren; Shuohang Wang; Liyuan Liu; Yang Liu; Yeyun Gong; Yanzhi Wang; yelong shen·· 2025-09-19精选AI 评分76

Routing Mamba:通过混合专家投影扩展状态空间模型

Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection

AI 导读

基于摘要分析。本文研究语言建模中如何高效扩展状态空间模型(SSMs)的表达能力,提出 Routing Mamba(RoM),以稀疏混合线性投影专家扩展 Mamba 参数规模,针对直接引入 Mixture-of-Experts(MoE)可能导致性能退化的问题提供一种结构化整合方法。 核心机制是使用稀疏的线性投影专家,并在投影层之间共享路由决策,同时在专家之间共享 Mamba 内部的轻量子模块,以利用投影专家之间的协同作用。摘要未提供具体路由算法、专家数量、激活策略、负载均衡损失或训练目标细节,这些实现条件尚未验证。 作者报告,在活跃参数为 1.3B、总参数为 10B、训练序列长度为 16K 的设置下,RoM 的语言建模表现相当于活跃参数需求超过其 2.3 倍的稠密 Mamba,并在不同上下文长度下保持一致的困惑度表现。作者还报告,在混合语言模型扩展实验中,相似性能下 RoM 相比稠密 Mamba 扩展节省 23% FLOPS。上述结果的具体数据集、数据划分、困惑度数值、上下文长度范围及计算量统计口径尚未验证,不能据此推断实际延迟或显存收益。摘要提供了训练代码库链接,但复现所需配置、权重与运行条件尚未核对;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其稀疏投影与共享路由机制可能用于长序列 EEG 编码,以条件激活专家降低扩大模型容量的计算成本;这是迁移假设,而非本文已验证的结果。原研究依赖语言序列与大规模模型训练,迁移时可复用投影专家及共享路由思路,但需改造 EEG 输入编码、通道组织与训练目标。低信噪比、跨被试差异及通道变化可能使路由依赖伪相关,小数据也可能导致专家利用不均或过拟合。一个可检验的小实验是在固定跨被试划分及相同 EEG 编码器输入下,对比稠密 Mamba 与 RoM 式稀疏投影模型,在匹配活跃计算预算时同时记录任务指标、专家利用率和实际延迟。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其共享路由与稀疏投影专家能否在保持长序列建模表现的同时降低活跃计算量,但摘要中的语言建模收益尚不能视为 EEG/BCI 有效性的证据。

来源:OpenReview · State space models · openreview.net