跳到正文
arXiv · 架构与算子· Ruwen Fan; Yuezhi Zu; Junru Li; Qingda Hu; Xinjun; Yang; Jiwu Shu; Youyou Lu·· 5 天前精选AI 评分76

利用 CoMoE 在消费级 GPU 上普及 MoE 推理

Democratizing MoE inference on commodity GPUs with CoMoE

AI 导读

基于摘要分析。该研究针对 MoE 推理依赖 Expert Parallelism 而产生的大量 GPU 间通信,提出通信高效的推理系统 CoMoE,主要研究对象是消费级多 GPU 上的推理部署,而非 EEG 解码或 BCI 算法。其核心贡献是将主机从被动中转节点改为主动路由中心,以适应带宽受限、缺乏 P2P 支持的互连环境。 在 token dispatch 阶段,CoMoE 使用 host-backed token multicast,将需要共享的 token 仅写入主机一次,减少重复的出站传输;在 token combine 阶段,系统通过主机暂存缓冲区进行细粒度、token 级聚合,替代刚性的全局同步,以减轻慢速执行单元造成的等待。摘要未给出具体调度实现、缓冲区管理或计算与通信重叠策略,这些细节尚未验证。 作者报告,在 RTX 5090 GPU 上评估时,CoMoE 的推理吞吐最高提升至对照系统的 1.46 倍,并以 A800 硬件成本的 23.4% 接近具备 NVLink 的 A800 GPU 性能。摘要未明确对照系统、MoE 模型、GPU 数量、批量大小、输入与输出长度及成本计算范围,因此这些结果不能外推为所有模型与部署配置下的收益;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 BCI 应用需要本地部署多 GPU MoE 模型,主机侧通信优化可能有助于降低硬件门槛,但这是部署层面的假设,不是 EEG/BCI 有效性证据。摘要侧重吞吐,尚不能判断交互式 BCI 所需的低批量推理延迟与时延稳定性;已有 EEG 相关工作尚未检索确认。代码可用性、模型兼容范围及复现所需软硬件配置亦尚未验证。

阅读价值

值得核对 CoMoE 如何利用主机中转拓扑减少 MoE 通信冗余与同步等待,但吞吐收益、硬件成本口径及其对 BCI 部署的适用性尚需验证。

来源:arXiv · 架构与算子 · arxiv.org