跳到正文
arXiv · 架构与算子· Yunkai Chai; Tong Zhu; Xiaoye Qu; Xuyang Hu; Guanjie Chen; Qipeng Guo; Yu Cheng·· 2 天前精选AI 评分73

平滑稀疏 Mixture-of-Experts 的 Top-k 暴露边界

Smoothing the Top-k Exposure Boundary for Sparse Mixture-of-Experts

AI 导读

基于摘要分析。本文研究稀疏 Mixture-of-Experts 中固定 top-k 路由造成的训练反馈边界:路由分数相近的专家可能因微小分数波动,分别进入获得监督与零反馈的区域。作者提出 Elastic Expert Routing,在训练时从以 k 为中心的局部离散分布中随机采样激活专家数量,使硬阈值在多次迭代中转化为渐变的激活概率。 机制上,该方法改变的是训练阶段的激活专家预算,而非摘要已明确给出的新损失或专家结构。作者称,对称的采样邻域使期望计算成本与确定性 top-k 训练匹配,同时保留推理预算;这不等于每个 token 或每一步的实际计算量固定。采样分布、边界处理、路由权重计算及与负载均衡机制的关系尚未验证。 作者报告,在监督微调设置下,OLMoE-1B-7B 与 Qwen3-30B-A3B 的下游宏平均分数分别提升 0.84 和 2.02 点;在从头预训练设置下,相对静态 top-k 基线,下游任务平均提升 1.6 点。摘要未提供任务组成、指标定义、数据划分及计算预算核算细节,因此这些数值不能解释为 Accuracy 提升或直接跨设置比较。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型采用稀疏专家路由,该机制可能缓解竞争专家在选择边界附近得不到反馈的问题,但原领域收益不等于 BCI 收益。可复用的是训练时随机专家数量机制;需适配的是 EEG 输入表征、专家分工与通道差异。低信噪比、小数据及跨被试分布变化可能使路由随机性增加优化方差。一个可检验的小实验是在相同 EEG 数据划分、期望专家计算预算和推理 k 下,对比固定 top-k 与 Elastic Expert Routing,并记录任务指标、专家激活分布及多随机种子波动。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其能否在不增加期望专家计算量的前提下改善 top-k 边界附近专家的训练反馈,尤其是随机专家预算的收益是否独立于训练计算波动与任务配置。

来源:arXiv · 架构与算子 · arxiv.org