MoE 预训练中的专家耦合:通过相关性放置与 Token 重排降低 All-to-All 通信开销
Expert Coupling in MoE Pretraining: Reducing All-to-All Overhead with Correlated Placement and Token Shuffling
基于摘要分析。本文研究 Transformer 中 Mixture-of-Experts(MoE)预训练的分布式通信瓶颈,利用层内专家共同选择及跨层路由相关性,提出相关性专家放置和 token 重排两种优化,减少跨 GPU、跨节点的数据传输;主要贡献是训练系统优化,而非 EEG/BCI 解码方法。 机制上,专家并行(EP)将专家分布到不同 GPU,token 在前向与反向传播中通过 all-to-all 通信完成分发和结果合并。作者报告,在每节点配置 8 张 AMD Instinct MI300X GPU 的集群上,EP32 下这类通信可占训练步耗时的 45%(top-2 路由)和 60%(top-6 路由)。作者观察到路由器在预训练早期已形成相关模式:top-2 条件下,层内 0.8% 的专家对被 42% 的 token 共同选中;本层选择也能预测下一层的专家选择。 相关性专家放置将经常共同选中的专家部署在同一 GPU,结合每个 token 向每张目标 GPU 仅发送一次的分发器,作者报告最多减少 58% 的分发行,但摘要未明确该最大值对应的配置。Token 重排依赖序列并行在 EP 组内划分 token,利用注意力后的 reduce-scatter,将 token 移至预测拥有其下一层专家的 GPU。作者报告,单节点条件下,本地 GPU 服务的 token—专家分配比例从 12.5% 提升至 59%。 在 Megatron-LM、EP8 至 EP64、top-2 与 top-6 路由的评估范围内,作者报告 all-to-all 通信耗时对应的加速比为 1.16–2.63 倍,端到端训练步加速最高为 1.41 倍。两种方法均不改变原有路由决策或专家参数。模型规模、训练数据、各项收益对应的具体配置、相关性估计开销,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 基础模型采用多 GPU MoE 预训练且通信成为瓶颈,可尝试复用专家放置与去重分发;token 重排则需适配序列并行实现。该假设依赖稳定的路由相关性与足够的并行规模,不代表低信噪比或跨被试泛化得到改善。小数据、通道变化或被试分布变化可能使相关模式不稳定。可在固定模型、数据划分和路由设置下,对比优化前后的通信量、训练步耗时及数值一致性;已有 EEG 相关工作尚未检索确认。
值得关注其利用路由相关性优化 MoE 专家放置与 token 通信、而不修改原始路由决策的机制,但加速收益依赖并行规模与硬件配置,EEG/BCI 适用性尚未验证。
来源:arXiv · 架构与算子 · arxiv.org