稀疏概率映射如何塑造混合专家模型的路由
How Sparse Probability Maps Shape Mixture-of-Experts Routing
基于摘要分析。该研究考察 MoE 路由中的稀疏概率映射能否在训练后保持随 token 变化的专家参与,并指出:实际参与情况取决于概率映射与学习到的路由分数的共同适应,而非映射产生精确零值的能力本身。 作者训练了规模匹配的 300M 和 1B、采用 top-2 路由的 MoE 语言模型,对比 softmax、1.5-entmax、sparsemax 和 2-normmax。作者报告,在 1B 模型中,entmax 相比 softmax 少丢弃 30% 的概率质量,却几乎不会使已选中的专家退出参与;sparsemax 保留的概率质量最多;normmax 则将 21% 的 token 路由到单个专家。这些指标分别描述概率质量保留与专家参与,不能等同于语言建模性能提升。 机制分析表明,各映射只有在两个最高路由分数之差达到固定阈值时,才会使已选中的一个专家获得零权重。作者报告,entmax 路由器学习到的分数离散程度约为 softmax 的一半,使 top-2 分数差保持在其阈值以下;sparsemax 与 normmax 虽共享相同阈值,却学习到不同的分数差分布。因此,静态映射的稀疏性并不能直接预测训练后的专家参与。 作者报告,没有一种稀疏映射的验证损失优于 softmax,但它们对推理时增加专家数的敏感性更低:以 K=2 训练、推理改为 K=8 时,sparsemax 的损失增加 0.02 nats,softmax 增加 0.58 nats。摘要未提供训练数据、完整评估协议及统计不确定性,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型采用 MoE,该机制可用于检验低信噪比或跨被试分布变化是否改变路由分数差,进而影响专家参与。可复用概率映射与分数差诊断,但需适配 EEG 的 token 表示与专家结构;小数据可能导致路由分布不稳定。一个可检验的小实验是在固定 EEG 编码器、专家数及数据划分下,对照 softmax 与稀疏映射,联合记录任务指标、单专家参与比例和分数差分布。语言模型中的结果不构成 EEG/BCI 有效性证据,已有 EEG 相关工作尚未检索确认。
值得阅读的具体原因是:作者通过匹配的 MoE 训练对照揭示稀疏概率映射与路由分数的共同适应,并报告其对推理时增加专家数量的敏感性差异,为自适应路由设计提供可核对的机制线索。
来源:arXiv · 架构与算子 · arxiv.org