MASKerade:用于稠密模型到 MoE 改造的 Token 路由掩码专家
MASKerade: Token-Routed Mask Experts for Dense-to-MoE Upcycling
基于摘要分析。MASKerade 研究如何复用预训练稠密模型构建稀疏激活的 Mixture-of-Experts(MoE),以冻结 FFN 权重上的可学习稀疏子网络替代复制并独立训练的专家,核心贡献是将专家连接结构学习与 Token 级路由联合优化。 每个专家由可学习的二值掩码定义,路由器为各 Token 选择需要执行并组合的掩码 FFN;训练更新路由器和掩码分数,底层 FFN 权重值保持不变。同一路由架构支持神经元结构化、半结构化和非结构化专家。主要配置采用四个 2:4 专家与 top-2 路由:每次执行两个半稠密专家,名义 FFN 算术量相当于一次稠密计算,且无需独立专家权重矩阵。该算术量关系不等同于已验证的端到端延迟或吞吐收益,仍需核对稀疏算子、路由和掩码执行开销。 作者报告,在使用 Qwen 和 Gemma 骨干的五个视觉语言基准上,该主要配置取得所比较基线中的最高性能;摘要未提供基准名称、指标、具体分数或数据划分,不能据此量化提升。作者还报告比较了掩码粒度、路由干预与计算量匹配对照,以区分学习连接结构和专家激活数量的作用;具体实验协议、消融结果及统计信息尚未验证。复现需进一步确认二值掩码的优化方式、路由训练目标、训练预算、骨干版本及稀疏计算实现。 平台推测(待验证):该机制可能用于已有 EEG 预训练模型中含 FFN 的编码器,以较少可训练权重形成输入相关的专家。但其依赖可复用的预训练 FFN 与适合路由的 Token 表示,原视觉语言结果不能直接外推至 BCI。需改造 EEG Token 构造和路由输入;低信噪比、跨被试分布变化、通道差异及小数据可能导致路由不稳定,冻结权重也可能限制域适应。可在固定 Cross-subject 划分与相同训练预算下,对比原稠密模型、冻结 FFN 的单掩码模型和 MASKerade,检验任务指标与实测推理开销是否同时改善。已有 EEG 相关工作尚未检索确认。
值得核对其冻结 FFN 权重、联合学习掩码与路由的专家构造机制,以及计算量匹配对照能否支持性能收益来自连接结构而非专家激活数量。
来源:arXiv · 架构与算子 · arxiv.org