ORCA:用于更快、更优 LLM 训练的退火谱条件调节优化器
ORCA: The Annealed Spectral Conditioning Optimizer for Faster, Better LLM Training
基于摘要分析。本文研究 LLM 训练中权重谱控制的两难:谱过度集中可能抑制耦合权重矩阵中的梯度方向,而全程维持约束可能限制任务适应。作者提出 ORCA(Orthogonal Regularization, Cooled After),在训练早期施加强但暂时的软正交正则化,随后移除,使权重先获得更宽的谱分布,再自由适应任务。 核心贡献是将谱约束由持续施加改为早期塑形、后期释放,而非改变模型架构。作者报告,在涵盖 LLaMA、Qwen3 和细粒度 mixture-of-experts 模型、参数规模为 130M 至 8B 的实验中,ORCA 的最终验证损失低于 Muon;相对 Muon 的损失降低幅度达到或超过 Muon 相对 Adam 的降低幅度。作者还报告消融支持这一阶段性设计,且额外开销很小。摘要未提供具体损失数值、训练数据、计算预算或开销测量条件,不能据此量化训练加速;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 模型中耦合权重矩阵也存在谱集中导致的优化瓶颈,早期软正交正则化可能具有复用价值,但 LLM 结果并不证明其对 BCI 有效。可复用的是正则化及其退出调度,需重新确定适用矩阵、约束强度和退出时机;EEG 的低信噪比、小数据及跨被试差异可能使早期谱扩展放大噪声或破坏有用的低秩结构。可在固定 Cross-subject 划分和相同训练预算下,对比不加约束、持续约束与早期约束后移除,联合观察权重谱、验证损失及 Balanced Accuracy。相关 EEG 工作尚未检索确认。复现仍需全文明确正则项、调度、基线配置及实现细节。
值得核对其“早期谱塑形、后期解除约束”的消融证据,以判断收益来自暂时改善优化条件还是持续正则化;其对 EEG 小样本训练的适用性尚未验证。
来源:arXiv · 架构与算子 · arxiv.org