DivMoE:跨域专家与约束路由上循环
先了解这件事
基于摘要分析。DivMoE针对稠密模型转为细粒度MoE时的路由坍塌与性能退化,从领域自适应持续预训练的稠密模型初始化专家,并以硬约束保证每个token激活不同领域组的专家。 作者报告:在两个基座、15个基准及六种上循环基线的评估中,DivMoE一致领先;Qwen3-1.7B平均准确率为55.6%,最强基线为51.6%。Stage 2持续预训练后,各基准均优于对应稠密基座。公开推理混合数据微调后,12B模型平均准确率64.5%,与16B Moonlight-MoE持平,比受控NVIDIA-Upcycling基线高6.1个百分点。 本次新增摘要证据,未提供可核对的版本改动。领域数据、基准划分、激活参数与训练预算、消融及微调阶段评估是否同口径尚未验证;“首个”声明尚未独立验证。这是语言模型成果,不能据此认定BCI迁移有效。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv · 架构与算子精选DivMoE:通过跨域专家组合实现细粒度 MoE Upcycling
基于摘要分析。该研究针对将预训练稠密模型转换为细粒度 Mixture-of-Experts(MoE)时的路由坍塌与性能退化,提出 DivMoE:组合来自不同领域的细粒度专家,并以结构性约束确保每个 token 激活来自不同领域组的专家。 机制上,DivMoE 从经过领域自适应持续预训练的稠密模型中初始化领域专化专家,再采用 diversity-constrained routing,强制激活专家的领域组互异。其思路是同时改变专家初始化来源与路由可选组合,而不是仅将单一来源模型拆分为更小专家。作者将其称为首个实现结构平衡路由的细粒度 MoE upcycling 框架;这一优先性声明尚未独立验证。专家划分方式、领域构成、具体训练目标与路由实现尚未验证。 作者报告,在 Qwen3-1.7B 上,Drop-Upcycling-fine-grained 在 15 个基准上的平均 Accuracy 为 23.2%,从头训练为 22.2%,同一方法的粗粒度版本为 50.2%。在两个基座模型、15 个基准和六种 upcycling 基线的评估范围内,作者报告 DivMoE 一致优于基线;其中 Qwen3-1.7B 上为 55.6%,最强基线为 51.6%。作者还报告,完成 Stage 2 持续预训练后,DivMoE 在每个基准上均优于对应稠密基座。经公开推理混合数据监督微调后,12B 参数 DivMoE 的平均 Accuracy 为 64.5%,与 16B 的 Moonlight-MoE 持平,并比受控 NVIDIA-Upcycling 基线高 6.1 个百分点;该阶段具体评估基准与前述基准是否一致尚未验证。 复现需核对领域预训练数据及成本、专家与激活参数预算、基准名称与划分、平均指标计算方式,以及初始化和硬路由约束各自的贡献。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 预训练模型具有可分离的任务或采集域,跨域专家初始化与受约束路由可能用于探索跨被试或跨数据集专家同质化问题;这是假设,不是已证实的 BCI 效果。迁移需改造信号编码与路由粒度,且低信噪比、小数据、通道差异或领域划分不当可能使强制跨域激活产生负迁移。可在固定训练预算与激活参数预算下,对比单域初始化、跨域初始化及加入硬路由约束的跨被试评估,同时记录专家利用率与任务指标。已有 EEG 相关工作尚未检索确认。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。