跳到正文

算法、任务与模态

MoE 最新动态

MoE 研究索引;按可核对的标签归档,不以热度评价质量。

26 条精选近 30 天 22 条共收录 28 条

更新

精选归档 · 第 2 页

10月3日周六第 21–26 条
  1. arXiv · 架构与算子75

    基于混合梯度的语言模型原则性 Top-k 选择方法

    基于摘要分析。该研究针对语言模型系统从 m 个候选项中选择最佳 k 项时,选择模块梯度信号较弱、探索与利用难以平衡的问题,提出一个具有明确建模目标的训练方法,其梯度同时包含监督梯度与策略梯度成分。 核心机制是通过所提出的选择目标获得混合形式的训练信号,而非仅依赖选择启发式。作者报告,选择问题随候选数量 m 增大而变得更困难,算法的收敛速率为 O(1/√T),并可通过平衡偏差与方差达到所分析的最优上界。摘要未说明 T 的具体定义、目标与梯度估计公式,以及收敛结论所需假设,理论适用范围尚需全文核对。 作者在合成回归、Retrieval-Augmented Generation(RAG)文档选择和 Mixture-of-Experts(MoE)专家路由任务中评估该方法,报告其相较基线改善了 next-token prediction 的困惑度与 QA Accuracy。摘要未给出数据集、划分、基线名称或具体数值,不能据此判断提升幅度或不同任务间的可比性;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型需要从候选通道、时间片段或专家模块中进行离散 top-k 选择,该混合梯度思路可能提供可复用的选择器训练框架。其迁移依赖可定义的候选集合、下游任务监督及可估计的选择收益;具体监督梯度项与策略梯度项如何适配 EEG,需依据全文公式确定。低信噪比、通道差异及小样本可能造成收益估计不稳定或选择器过拟合。一个可检验的小实验是在固定 EEG 解码骨干、候选通道集合与 k 的条件下,对比该方法与原有选择器,并分别报告被试内和跨被试 Accuracy 及多随机种子波动。上述迁移尚未验证,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其 top-k 选择目标如何结合监督梯度与策略梯度,以及偏差—方差平衡的理论条件;摘要报告了 RAG 和 MoE 任务收益,但具体对照与复现条件尚未验证。

  2. arXiv · 架构与算子75

    ExpertMuon-Compass:用于混合专家训练的对齐引导步长

    基于摘要分析。该研究针对混合专家(MoE)语言模型中各专家接收的数据不同且随训练变化、共享学习率难以反映专家更新质量的问题,提出 ExpertMuon-Compass(Compass):保留 Muon 的更新方向与动量缓冲,通过两个对齐因子调整每个专家的更新步长。 核心机制是将专家的 Muon 步乘以两个因子:family factor 比较该专家正交化更新与当前梯度的余弦相似度和同层其他专家的对应相似度;scalar radius 将更新与梯度对应行之间的对齐信息聚合为一个步长乘数。方法主要改变更新幅度,而非更新方向。作者还报告证明了两个因子的扰动界,但具体假设、界的形式及适用范围尚未验证。 作者报告,在 FineWeb-Edu 预训练中,对所有矩阵使用 Nesterov 动量的 Compass 表现不逊于或优于 Muon、NorMuon 及其他优化器;较长训练运行中的权重衰减与 NorMuon 匹配。将这些因子加入 NorMuon 后,作者报告损失相同或更低。摘要未提供模型规模、训练预算、具体损失数值与数据划分,不能据此量化收益。作者报告,当专家所见数据在训练过程中变化时效果最明显,例如多语言语料按语言分块到达的设置;同时专家负载保持均衡,路由器的 token 分配更为明确。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型采用 MoE,且不同专家因被试、会话或任务路由而接收非平稳数据,对齐引导步长可能对应专家间更新可靠性不一致的瓶颈。可复用步长缩放机制,但需适配专家矩阵及路由方式;该机制依赖可计算的专家梯度、正交化更新及同层专家比较,不能直接推广到没有专家结构的模型。低信噪比、小数据和稀疏路由可能使对齐估计不稳定,通道差异也可能改变专家分工。一个可检验的小实验是在固定 EEG MoE、Cross-subject 划分与训练预算下,对照 Muon 和 Compass,比较预先指定的任务指标、专家负载与对齐因子稳定性,并分别移除两个因子。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其基于更新—梯度对齐调整专家步长的机制,以及与 Muon、NorMuon 在权重衰减匹配条件下的比较;摘要报告的收益尚需结合完整训练协议与消融验证。

9月8日周二
  1. OpenReview · EEG76

    PRiSE-EEG:采用深度分层专家的先验引导基础模型,用于跨范式 EEG 表征学习

    基于摘要分析。该研究针对不同 EEG 范式之间的优化冲突与表征共享差异,提出先验引导的 EEG 基础模型 PRiSE-EEG,通过 CKA 校准的深度分层专家配置,在浅层保留共享表征、在深层增加专用处理能力,以支持跨范式 EEG 表征学习。 机制依据:作者对 dense EEG Transformers 开展两类分析。在六个下游数据集上的梯度相似性分析中,作者报告不同 EEG 范式之间存在明显优化冲突;对混合范式批次的 CKA 分析则显示,浅层具有较强跨范式相似性,深层表征逐渐专门化。这些发现用于指导专家配置,而非在所有层采用统一适配方式。 模型设计:PRiSE-EEG 结合弱静态皮层与网络先验,以及动态短时通道交互,构建连续多通道 EEG patches;再通过对逐层 CKA 共享程度的 sigmoid 映射,在 MoE Transformer 各模块中配置共享与专用专家。摘要未说明先验的具体构建方式、通道交互计算、专家路由、损失函数或预训练设置,相关实现细节尚未验证。 结果与对照:作者报告模型在 12 个公开 EEG benchmarks 上表现较强,并报告简要消融中,CKA 驱动的专家配置优于 dense Transformers、uniform MoE 及人工固定的共享—专用专家比例。摘要未提供 benchmark 名称、任务组成、指标数值、被试与数据划分,也未明确这些比较采用何种下游微调或联合训练协议,因此不能量化收益,或据此确认跨被试、跨会话、跨数据集泛化能力。 复现重点:材料提供匿名代码仓库,但其内容与可运行性尚未验证。阅读全文时应核对 CKA 校准所用数据、专家总容量与计算预算是否匹配、下游适配协议,以及先验模块和专家分配各自的贡献;实验协议、消融及统计信息尚未验证。

    阅读价值:值得核对其由层级 CKA 相似性驱动共享与专用专家分配的机制,以及相对 dense Transformer、uniform MoE 和固定专家比例的消融;摘要尚不足以确认跨范式收益的幅度与评估协议。

9月27日周五
  1. OpenReview · EEG74

    EEGMamba:结合混合专家的双向状态空间模型用于 EEG 多任务分类

    基于摘要分析。该研究针对 EEG 分类中长序列建模的计算开销,以及不同任务之间信号长度、通道数不一致带来的适配问题,提出 EEGMamba,将 Spatio-Temporal-Adaptive(ST-Adaptive)模块、双向 Mamba 和 Mixture of Experts(MoE)整合为多任务分类框架。 机制上,ST-Adaptive 通过空间自适应卷积对不同长度与通道数的 EEG 进行统一特征提取,并引入 class token 实现时间维度适配;双向 Mamba 用于进一步提取 EEG 特征,旨在兼顾长序列处理的分类表现、推理速度与内存使用;任务感知 MoE 配置通用专家,以建模不同 EEG 任务之间的差异与共性。摘要未提供这些模块的具体结构、专家路由方式、损失函数或多任务训练流程,相关细节尚未验证。 作者报告在八个公开 EEG 数据集上开展评估,覆盖癫痫发作检测、情绪识别、睡眠分期分类和运动想象四类任务,并报告具有性能优势;但摘要未列出数据集名称、被试数、数据划分、对照基线或具体指标,因此尚不能判断优势对应被试内、跨被试、跨会话还是跨数据集协议,也不能将多任务学习直接等同于对未见任务的泛化。作者将其称为首个真正实现 EEG 多任务学习的通用分类网络,该优先性主张尚未检索确认。 复现时需核对不同任务是否联合训练、任务信息如何用于 MoE 路由、通道与长度适配的实现,以及各模块的消融结果;推理速度和内存优势还需结合硬件、输入长度及比较基线核验。实验协议、消融及统计信息尚未验证。材料仅表示代码计划近期发布,不能据此确认代码或预训练权重已公开。

    阅读价值:值得阅读的是 EEGMamba 将长度与通道适配、双向状态空间建模及任务感知专家机制组合用于 EEG 多任务分类,但其多任务训练协议、性能优势和计算效率仍需全文核对。

5月28日周二
  1. OpenReview · Representation learning75

    以多样性实现统一:改进多模态 VAEs 的表征学习

    基于摘要分析。该研究针对多模态 VAEs 中共享表征的硬约束可能限制模态信息保留的问题,提出 mixture-of-experts prior,以软约束引导各模态的潜在表征靠近共享的 aggregate posterior。核心贡献是用较柔性的跨模态对齐替代编码器输出、解码器输入或二者的强制共享。 机制上,作者认为现有共享结构对模型施加了硬约束,而所提先验可在形成共同表征的同时,更好地保留各模态原始特征中的信息。摘要未给出先验的具体参数化、aggregate posterior 的构造方式、损失形式及训练与推理流程,不能据此判断其实现复杂度或与既有方法的结构差异。 作者报告,在多个基准数据集及一个具有挑战性的真实神经科学数据集上,相比现有方法,所学潜在表征和缺失模态补全均有改善。摘要未提供数据集名称、神经信号类型、被试数、划分协议、对照方法或具体指标;实验协议、消融及统计信息尚未验证,也无法判断表征改善对应何种下游任务。 平台推测(待验证):假设用于 EEG 与其他同步模态的联合建模,软共享机制可能缓解不同模态信息被强制压入共同表征的瓶颈。其依赖模态间存在可学习的共享结构,配对数据与监督条件仍需核对;可考虑复用先验与软对齐思想,但需改造 EEG 编解码模块及缺失模态处理流程。低信噪比、跨被试差异、通道变化和小数据条件可能使共享表征受较强模态主导。一个可检验的小实验是在同一配对数据与固定跨被试划分下,对比硬共享和软约束模型,并在预先规定的模态缺失条件下评估补全及下游任务表现。以上不是已验证的 EEG/BCI 结果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其 mixture-of-experts prior 如何在跨模态共享与模态特有信息保留之间实现软约束,以及缺失模态补全的收益是否在不同缺失条件下稳定;摘要中的神经科学实验尚不足以确认 EEG/BCI 适用性。

1月1日周一
  1. OpenReview · EEG73

    EEGMamba:用于 EEG 分类的双向状态空间模型与混合专家

    基于摘要分析。EEGMamba 面向不同任务中 EEG 信号长度、通道数不一致,以及 Transformer 长序列建模计算开销较大的问题,将 Spatio-Temporal-Adaptive(ST-Adaptive)模块、Bidirectional Mamba 和 Mixture of Experts(MoE)整合为统一的多任务 EEG 分类框架。 机制上,ST-Adaptive 通过空间自适应卷积对不同长度和通道数的 EEG 进行统一特征提取,并引入 class token 实现时间维度适配;摘要未说明具体的长度对齐与通道映射方式。Bidirectional Mamba 用于进一步提取 EEG 特征,作者旨在兼顾长序列处理的分类准确性与推理速度。Task-aware MoE 配置一个通用专家,以建模不同任务 EEG 的差异与共性;专家路由、任务信息如何输入以及训练损失尚未验证。 作者报告,在八个公开 EEG 数据集上进行了测试,覆盖癫痫发作检测、情绪识别、睡眠分期和运动想象四类任务,并报告性能优于对照方法。摘要未提供数据集名称、被试规模、评价指标、具体分数或对照基线,也未明确被试内、跨被试、跨会话或跨数据集划分,因此不能据此确认对未见任务的泛化能力,或量化准确性与速度之间的收益。 复现时应重点核对多任务联合训练与评估协议、异构通道和序列长度的处理,以及 ST-Adaptive、双向建模和通用专家各自的贡献;推理效率比较还需结合输入长度、硬件与计时条件。实验协议、消融及统计信息尚未验证。摘要称代码将于近期发布,当前材料不能确认代码已公开。

    阅读价值:值得核对 EEGMamba 如何通过输入适配、双向状态空间建模和任务感知专家机制处理异构 EEG,但其跨任务泛化与推理效率优势仍需结合全文中的训练划分和对照实验验证。