跳到正文
arXiv · 架构与算子· Tate Berenbaum; Matias Parij; Muthaiah Venkatachalam·· 4 天前精选AI 评分77

Cascadia:在十一台 AI PC 上进行 975B MoE 驻留式推理

Cascadia: Resident 975B MoE Inference on Eleven AI PCs

AI 导读

基于摘要分析。该研究解决超大规模 Mixture-of-experts(MoE)模型在分布式客户端设备上的权重驻留与执行协调问题,提出 Cascadia 驻留式推理引擎,在十一台 AI PC 上运行总参数量 975B、每 token 激活参数量 41B 的 Inkling。 系统使用十一台 Intel Core Ultra X7 358H AI PC,每台配备 64 GB 内存、Arc B390 集成 GPU 和千兆以太网。引擎保留 Inkling 的路由规则,为 OpenVINO 融合集成 GPU 算子构建压缩图,并协调 FP16 专家计算与 FP32 输出恢复。每台机器容纳六个连续 decoder 层,将稠密前馈块表示为全部激活的专家切片。作者报告,在所测配置下,稠密层调用时间由约 8.1 ms 降至 4.5 ms;具体计时边界尚未验证。 流式流水线支持并发生成。作者报告,在覆盖 1 至 176 条流的十五个并发档位配对测量中,88 条流时聚合解码吞吐达到 60.29 tokens/s,完整服务阶段吞吐为 46.87 tokens/s;十五条流时,首 token 延迟中位数为 6.05 s。这些是集群聚合吞吐与特定并发条件下的延迟,不能解释为单条流的生成速度。 将上下文预算从默认的 1,024 个位置提高后,作者报告:在 1k 至 64k tokens 的真实提示测试中,全部 19 个测量回答均恢复了嵌入代码。该结果仅支持所测代码检索情境,不等同于通用长上下文能力。首 token 时间按 aN+bN² 增长,解码延迟近似线性增长;作者将瓶颈归于单线程 CPU attention 循环,而非内存容量,并称内存可容纳每条流 512k 个位置,不能据此推断已完成该长度的有效推理测试。 研究还通过捕获集群状态评估草稿与已部署数值路径的一致性,区分词表选择和权重量化的影响,但摘要未给出一致性数值。实验协议、消融及统计信息尚未验证,代码与复现资源也尚未确认。平台推测(待验证):驻留权重和共享 CPU-GPU 内存执行思路可能用于大型 EEG 基础模型的部署,但依赖模型结构与硬件算子适配,不构成已验证的 BCI 效果;已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其驻留式 MoE 执行、集成 GPU 算子适配与分布式流水线设计,尤其是并发吞吐、完整服务阶段吞吐和长上下文瓶颈的分开评估;其对 EEG/BCI 模型部署的价值尚未验证。

来源:arXiv · 架构与算子 · arxiv.org