跳到正文
arXiv · 架构与算子· Arnab Kanti Tarafder; Jaume Guasch-Martí; Gokcen Kestor; Jie Ren·· 4 天前精选AI 评分80

分布式 MoE 训练中的内存高效专家路由

Memory-Efficient Expert Routing for Distributed MoE Training

AI 导读

基于摘要分析。该研究针对分布式 Mixture-of-Experts(MoE)训练中随 top-k 路由扩张的中间缓冲区内存瓶颈,提出环形执行模型 RelayMoE:让专家权重或 token 在环中流转并在本地计算,避免一次性构造完整的 top-k 扩张派发缓冲区。 核心机制:摘要指出,标准 all-to-all dispatcher 在单次集合通信中发送全部已路由 token,需要同时准备完整扩张缓冲区。RelayMoE 根据通信量选择专家路由或 token 路由,并将数据传输与计算重叠。反向传播时,环形结构支持逐跳重计算:每一跳重建专家中间结果、计算梯度,随后释放中间结果,再进入下一跳。节省的内存可用于更长序列、更大批量,或保留更多 attention 激活以减少其重计算;这属于执行与内存管理机制改造,而非摘要中已说明的新路由学习目标。 作者报告,在 30B–57B 生产级 MoE 模型及不同专家配置上进行评估;单层 MoE 实验相较 Megatron-LM 获得平均 2 倍加速。在相同 GPU 内存预算下的全模型训练中,作者报告吞吐量最高提升至 2.02 倍,最大已测试可训练序列长度最高扩展至 2.85 倍。两类实验的统计口径不同,不应将单层加速直接等同于端到端收益。 需核对 GPU 配置、互连条件、精度、批量与序列长度设置、专家配置、top-k、基线优化及重计算策略,才能判断收益来自哪些条件。实验协议、消融及统计信息尚未验证,代码与复现条件也尚未验证。平台推测(待验证):该机制可能适用于训练阶段受 MoE 派发内存限制的大规模 EEG 基础模型,但前提是模型采用 MoE 且确有这一瓶颈;小规模 EEG 训练可能因环形通信与重计算开销而无法获益。尚未检索确认已有 EEG 相关工作,不能将通用模型上的结果视为 BCI 效果证据。

阅读价值

值得核对 RelayMoE 如何通过环形路由与逐跳重计算降低 MoE 中间缓冲区峰值内存,以及相同 GPU 内存预算下吞吐收益的适用条件;摘要尚不足以判断其通信开销与扩展性边界。

来源:arXiv · 架构与算子 · arxiv.org