TRACE:面向 MoE 语言模型 FP4 强化学习的 rollout 引导量化感知训练
TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models
基于摘要分析。研究针对大型语言模型强化学习后训练中 rollout 生成的计算与显存开销,提出面向 Mixture-of-Experts(MoE)语言模型的 FP4 量化框架 TRACE(Train-Rollout Quantization Alignment via Compact GuidancE)。其核心贡献是利用 rollout 侧量化结果指导训练侧 FP4 舍入,直接减小训练与 rollout 两条量化执行路径之间的差异,而非仅分别优化各自的量化精度。 机制上,TRACE 将 rollout 引导纳入量化感知训练,并选择性缓存较深层的尾数与尺度信息,以降低引导信息带来的存储及通信开销。摘要未给出舍入规则、引导信号的具体形式、缓存层选择依据或训练目标,相关实现细节尚未验证。 作者报告,在四个大规模 MoE 语言模型上,覆盖推理、代码及长时程 RL 任务,TRACE 支持权重与激活均采用 FP4,并使用 FP4 KV-cache 进行 rollout;其 RL 表现可与 BF16 rollout 相当,rollout 加速最高达 5.4 倍。作者还报告,相较于对 BF16 训练策略进行事后 FP4 量化,TRACE 的最终 FP4 表现更强。摘要未列出模型名称、任务数据、性能指标、硬件及加速测量配置,因此上述结果仅限作者所述评估范围,不能推广为通用加速保证;实验协议、消融及统计信息尚未验证。 平台推测(待验证):该工作的潜在借鉴点是低精度训练与部署路径的量化一致性,而非直接提供 EEG/BCI 方法。其机制依赖可获取的 rollout 侧量化信息和相应 RL 训练流程,能否适用于其他神经信号模型仍需评估;已有 EEG 相关工作尚未检索确认。复现时需核对 FP4 格式、量化算子、缓存策略及 BF16 对照设置,并区分计算加速与额外通信、存储成本。
值得核对其利用 rollout 侧量化信息对齐训练侧 FP4 舍入的机制,以及性能与缓存开销的权衡;作者报告的最高 5.4 倍 rollout 加速仍需结合硬件、任务和基线配置验证。
来源:arXiv · 架构与算子 · arxiv.org