循环自我改进:面向循环语言模型的动态跨循环 On-Policy 蒸馏
Recurrent Self-Improvement: Dynamic Cross-Loop On-Policy Distillation for Looped Language Models
基于摘要分析。该研究针对循环语言模型(LoopLMs)的后训练问题,提出跨循环 On-Policy 蒸馏框架 LoopOPD,将同一模型较深循环的计算结果作为较浅循环的监督来源;进一步提出 Dynamic LoopOPD(D-LoopOPD),通过持续刷新教师实现循环自我改进。 LoopLMs 在多次循环计算中复用共享参数,以参数高效的方式增加推理计算。作者指出,现有后训练方法面临奖励监督稀疏、向各循环扩展监督成本较高,或依赖外部教师与特权信息等限制。LoopOPD 在学生生成的 rollout 上,以冻结的末端循环策略作为拥有额外计算预算的教师,监督中间循环学生。其核心区别是利用计算深度差异,而非外部教师或额外信息,提供密集监督。D-LoopOPD 则随共享模型参数更新持续刷新末端循环教师。 理论方面,作者分析蒸馏更新如何传播至不同循环深度,并推导单次更新使两个循环深度同时获得局部改善的充分条件。这不等同于对任意训练过程或全局性能改善的保证,具体条件及适用范围需核对正文。 作者报告,在 Ouro-Thinking 模型上的实验中,LoopOPD 改善数学推理,D-LoopOPD 通过动态教师更新获得进一步收益;仅用数学数据训练后,模型在通用推理和代码生成基准上也有所改善。摘要未提供具体基准、数据划分、对照设置或指标数值,实验协议、消融及统计信息尚未验证。代码与模型检查点计划在论文被接收后发布,当前材料不能确认已接收或已开放复现资源。 平台推测(待验证):跨计算深度自蒸馏可能启发具有共享参数迭代结构的 EEG 模型,但语言生成中的 rollout 与 EEG 解码并不直接对应;需改造监督目标,并检验低信噪比、小样本和跨被试差异是否导致较深循环放大错误。尚未检索确认已有 EEG 相关工作,摘要不足以支持具体 BCI 效果判断。
值得核对其利用同一模型额外循环计算提供蒸馏监督的机制,以及动态教师更新实现不同循环深度共同改善的理论条件;摘要报告了推理收益,但具体评估协议与收益幅度尚未验证。
来源:arXiv · 在线与高效推理 · arxiv.org