DivMoE:通过跨域专家组合实现细粒度 MoE Upcycling
DivMoE: Fine-Grained MoE Upcycling via Cross-Domain Expert Composition
基于摘要分析。该研究针对将预训练稠密模型转换为细粒度 Mixture-of-Experts(MoE)时的路由坍塌与性能退化,提出 DivMoE:组合来自不同领域的细粒度专家,并以结构性约束确保每个 token 激活来自不同领域组的专家。 机制上,DivMoE 从经过领域自适应持续预训练的稠密模型中初始化领域专化专家,再采用 diversity-constrained routing,强制激活专家的领域组互异。其思路是同时改变专家初始化来源与路由可选组合,而不是仅将单一来源模型拆分为更小专家。作者将其称为首个实现结构平衡路由的细粒度 MoE upcycling 框架;这一优先性声明尚未独立验证。专家划分方式、领域构成、具体训练目标与路由实现尚未验证。 作者报告,在 Qwen3-1.7B 上,Drop-Upcycling-fine-grained 在 15 个基准上的平均 Accuracy 为 23.2%,从头训练为 22.2%,同一方法的粗粒度版本为 50.2%。在两个基座模型、15 个基准和六种 upcycling 基线的评估范围内,作者报告 DivMoE 一致优于基线;其中 Qwen3-1.7B 上为 55.6%,最强基线为 51.6%。作者还报告,完成 Stage 2 持续预训练后,DivMoE 在每个基准上均优于对应稠密基座。经公开推理混合数据监督微调后,12B 参数 DivMoE 的平均 Accuracy 为 64.5%,与 16B 的 Moonlight-MoE 持平,并比受控 NVIDIA-Upcycling 基线高 6.1 个百分点;该阶段具体评估基准与前述基准是否一致尚未验证。 复现需核对领域预训练数据及成本、专家与激活参数预算、基准名称与划分、平均指标计算方式,以及初始化和硬路由约束各自的贡献。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 预训练模型具有可分离的任务或采集域,跨域专家初始化与受约束路由可能用于探索跨被试或跨数据集专家同质化问题;这是假设,不是已证实的 BCI 效果。迁移需改造信号编码与路由粒度,且低信噪比、小数据、通道差异或领域划分不当可能使强制跨域激活产生负迁移。可在固定训练预算与激活参数预算下,对比单域初始化、跨域初始化及加入硬路由约束的跨被试评估,同时记录专家利用率与任务指标。已有 EEG 相关工作尚未检索确认。
值得核对其通过跨域专家初始化与硬路由约束缓解细粒度 MoE upcycling 退化的机制,并复现同一基座下的对照;摘要中的性能提升仍需结合训练预算、路由统计及消融验证。
来源:arXiv · 架构与算子 · arxiv.org