跳到正文
10月5日周一
  1. arXiv · 架构与算子74

    CIPHER-MoE:平衡万亿规模 MoE 训练的效率与路由保真度

    基于摘要分析。CIPHER-MoE 针对大规模 LLM 的 MoE 训练中非均匀 token 路由造成的专家及设备负载失衡,提出结合亲和度感知 Expert-to-Token 过滤与显式容量控制的方法,在保持路由器 token 侧 Top-K 选择不变的前提下削减热点专家负载。 核心机制是从专家侧过滤分配给专家的 token,而非改变 token 侧的 Top-K 选择。摘要将其与复杂并行策略、资源重分配等系统方案区分,强调不需要额外硬件资源或复杂运行时设计。但保持 Top-K 选择不变不等于所有被选中的专家都实际处理对应 token;过滤后的计算路径、亲和度定义、容量设定以及未获处理 token 的处置方式,均需核对全文。 作者报告,在包括 DeepSeek-V4-Pro 在内的大规模 MoE 模型评估中,Top-1 专家工作负载降幅最高达 64.9 个百分点,训练加速为 1.10×–1.94×,并保持训练质量。摘要未给出这些数值对应的具体模型配置、硬件、数据划分、对照基线及质量指标,因此不能据此推断各模型均达到最高收益,也不能直接比较不同设置。实验协议、消融及统计信息尚未验证。摘要称代码将于近期发布,当前材料未提供可用实现。 平台推测(待验证):若 EEG 基础模型采用 MoE,专家侧容量控制可能缓解路由热点;这一假设依赖模型确实存在负载失衡及可用于过滤的亲和度信息。可复用的是专家侧过滤与容量约束,需改造的是 EEG token 定义及过滤策略。低信噪比、跨被试差异和小数据条件下,过滤可能丢弃稀有但有判别价值的信号。可在固定 EEG MoE、数据划分与硬件下,对比原始路由和加入过滤后的专家负载、吞吐及任务指标,检验效率收益是否伴随性能损失。相关 EEG 工作尚未检索确认。

    阅读价值:值得核对其在保持 token 侧 Top-K 选择不变时如何通过专家侧容量控制缓解负载热点,尤其是训练加速、路由保真度与训练质量之间的取舍。

10月4日周日
  1. arXiv · 架构与算子71

    LoopMoEVR:用于统一 UHD 视频复原的基于循环的退化感知混合专家模型

    基于摘要分析。LoopMoEVR 面向统一 UHD 视频复原中依靠增加模型深度却收益有限的问题,将循环学习与退化感知混合专家机制结合,用输入相关的条件与自适应循环次数处理不同退化任务。 机制上,退化条件化的低秩循环嵌入生成依赖输入的阶段条件;时空迭代自适应归一化模块 IterAda3DN 融合局部特征与全局循环上下文,实施逐位置仿射调制。专家分支进一步结合经注意力更新的局部、全局视频状态及循环条件,生成专用调制参数;输入条件化的深度预测器则自适应确定循环迭代次数。摘要未给出专家路由、循环参数共享方式、损失函数及训练细节,这些内容尚未验证。 作者报告,模型仅含约 0.884M 个可训练参数,可统一处理 UHD 视频去雾、去雨、去噪和低照度增强,并在公开基准与真实场景中达到最先进复原性能。摘要未提供具体数据集、划分、指标、对照基线及分数,因此无法核对该性能主张,也不能将较少可训练参数直接等同于更低推理延迟或显存占用。实验协议、消融及统计信息尚未验证;复现还需核对 UHD 输入规格、退化构造、迭代次数分布及代码与权重可用性。 平台推测(待验证):跨领域迁移假设是,退化条件化调制与循环精炼可能用于 EEG 去噪或伪迹抑制,对应信号污染类型变化这一瓶颈。可考虑复用条件生成与迭代深度控制机制,但需将视频时空特征模块改为适合 EEG 时间与通道结构的实现,并明确退化监督或干净参考的来源。低信噪比、跨被试差异、通道布局变化及小数据可能使条件预测失准,或使反复精炼抹除任务相关信号。一个可证伪的小实验是在固定 EEG 划分和相同伪迹条件下,对比固定循环次数与自适应次数,同时检查去噪指标及下游任务表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其退化条件化循环、专家调制与自适应迭代深度如何以较少可训练参数统一多种视频复原任务,但摘要中的性能主张及计算效率尚需全文验证。

  2. arXiv · 架构与算子75

    基于自适应单位分解混合专家网络的局部化算子学习

    基于摘要分析。针对 DeepONets、FNOs 在具有尖锐界面、异质系数和局部多尺度结构的 PDE 族上的建模困难,本文提出基于单位分解(partition-of-unity,POU)的局部化混合专家框架,并以 HiRefPOU 为主要贡献,在局部表征之间保持全局连续性。 核心机制是由几何感知门控网络生成平滑空间分区,融合各局部专家网络的贡献。HiRefPOU 面向 DeepONets,采用残差式层级 POU 架构,通过嵌套的父子分区组织局部表示。作者还将同一 POU 原则用于 Fourier Neural Operators,在不修改底层频谱层的情况下引入空间适应性。摘要未提供门控参数化、分区细化规则、损失函数或训练配置,其具体实现尚未验证。 作者报告,在异质 Darcy 与 reaction-diffusion 基准上,HiRefPOU 相比全局 DeepONet 和静态 POU-MoE 基线取得明显更低的误差,但摘要未给出具体误差指标、数值或数据划分。作者同时报告,更广泛的算子学习实验表明,局部化收益依赖 PDE 结构及所选神经算子骨干;学习到的分区与界面及解快速变化的区域相对应,支持其可解释性主张。实验协议、消融及统计信息尚未验证,不能据此推断所有算子任务均受益。 平台推测(待验证):若 EEG 任务能表述为具有明确空间几何的函数到函数映射,该框架或可用于处理空间异质性,但 PDE 中的几何界面不等同于 EEG 的功能分区。可复用模块是平滑门控与局部专家融合,需改造电极几何表示及任务输入输出;低信噪比、稀疏通道、跨被试差异和小数据可能使分区不稳定或专家过拟合。一个可检验的小实验是在固定被试内划分的 EEG 通道重建任务上,以相同训练预算比较全局算子、静态 POU 与自适应 POU,并检查重建误差和分区稳定性。该迁移并非本文已验证结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其通过平滑空间分区与层级局部专家兼顾局部适应性和全局连续性的机制,且作者报告定位收益依赖 PDE 结构及算子骨干,有助于界定方法适用范围。

10月3日周六
  1. arXiv · 架构与算子74

    COSMOS:用于长时域 PDE 预测的软机制混合与可验证路由

    基于摘要分析。COSMOS 针对多种物理过程并存时,单体神经算子与稀疏专家路由难以表达连续组合的问题,提出软机制混合神经算子,并构建具有已知轨迹混合权重的算子分裂组合基准,用于检验预测性能与路由解释。 核心机制:四个带有过程偏置的专家在每一步均保持激活,由学习得到的门控连续混合,再通过小型网络融合特征。专家共享粗粒度潜在网格,并以零初始化的全分辨率残差恢复瓶颈损失的细节。该设计以同时参与的专家替代稀疏 top-K 选择;具体损失、训练流程及网络规模尚未验证。 作者报告,在与按方程族调优的 FNO 比较、采用 20 步滚动预测的初始 3 个随机种子评估中,COSMOS 在 diffusion–reaction 上呈现收益,在 Navier–Stokes 上表现相当,在 shallow-water 上较弱;随后 11 个随机种子的审计表明 diffusion–reaction 收益不稳定,因此不能据此可靠宣称这些方程族上的精度优势。作者报告,均匀路由或移除专家混合会显著降低稳定状态下的滚动预测表现。 在带路由标签的组合基准上,作者报告,相同特征融合条件下,稠密软路由的误差比硬 top-1 路由低 2.2 倍;推理时使用生成器的真实混合权重 w*,滚动预测误差进一步降至 0.034。摘要未明确该误差的指标定义、归一化方式及完整评估协议,不能与其他任务分数直接比较。路由标签与专家预设机制并不对应,因此结果支持组合预测能力,而非机制身份解释;真实权重干预则提示学习门控仍有限制。 平台推测(待验证):若将软专家混合用于 EEG 时空预测,可复用连续门控与多专家融合,但 PDE 过程偏置、潜在网格和机制标签均需重新设计;EEG 的低信噪比、通道差异与小数据可能造成专家退化或门控不稳定。一个可证伪的小实验是在固定跨被试划分、相同融合模块及相近模型容量下,比较软路由、硬 top-1 与均匀路由,并用多随机种子检查预测误差收益是否稳定;这不等同于验证 EEG 生理机制。已有 EEG 相关工作尚未检索确认。完整数据划分、消融设置及统计信息尚未验证。

    阅读价值:值得阅读的是作者通过多随机种子审计修正初步精度结论,并用已知混合权重区分软路由的组合预测价值与机制身份解释的局限。