跳到正文
arXiv · 架构与算子· Xin Teng; Muxiao Li; Hongyi Wen·· 4 天前精选AI 评分79

分布鲁棒的 Mixture-of-Experts 训练

Distributionally Robust Mixture-of-Experts Training

AI 导读

基于摘要分析。该研究针对 Mixture-of-Experts(MoE)transformer 的路由可靠性问题:即使专家负载均衡,不完善的路由仍可能将 token 分配给对相应输入训练不足的专家。作者提出 Distributionally Robust MoE Training(DRMoET),将每层专家视为内生鲁棒性分组,以高损失路由结果为优化重点,而非仅均衡流量。 机制上,DRMoET 根据经指数移动平均(EMA)平滑、按激活加权的专家损失,通过熵正则化 softmax 规则更新逐层专家分布。摘要称这一可直接接入的训练目标能够强化合理的非首选路由路径,同时保留标准 MoE 计算方式。具体损失公式、分布更新与路由器训练的耦合方式尚未验证。 作者报告,在 FLAME-MoE 训练配置下,746M 与 10.3B 总参数规模的模型均取得了优于标准 FLAME-MoE 和无需辅助损失的负载均衡基线的下游平均表现。其中,10.3B 总参数、67B 训练 token 条件下,七任务平均分由标准基线的 0.6625 提升至 0.6767,无需辅助损失的基线为 0.6431;摘要未列出任务名称及平均分的具体指标定义。作者还报告,专家损失方差降低而平均损失基本不变,强制 mid-k 误路由条件下的额外损失降低 4.3%,并观察到领域—专家专门化改善。数据划分、误路由干预细节、消融及统计信息尚未验证。摘要提供了项目与代码入口,但实现及复现条件尚未核查。 平台推测(待验证):若 EEG 模型采用稀疏 MoE,且能够稳定估计各专家的激活加权损失,该目标可能用于缓解跨被试或跨会话分布变化下的错误路由;可复用部分是专家损失平滑与鲁棒分布更新,需改造输入表征及任务损失。EEG 低信噪比、小数据量和专家激活不足可能使高损失估计不稳定,甚至过度强调噪声样本。一个可证伪的小实验是在固定跨被试划分、相同模型与训练预算下,对比标准负载均衡和 DRMoET,并施加一致的受控误路由,检验任务指标与额外损失是否同时改善。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 DRMoET 是否通过强化高损失路由路径而非仅平衡专家负载改善 MoE 可靠性,尤其是强制误路由测试与专家损失方差分析;具体实验协议尚未验证。

来源:arXiv · 架构与算子 · arxiv.org