跳到正文
arXiv · 多模态与生成机制· Wenxuan Wang; Zekai Liu; Weinan Zhang; Yu Cheng; Yang Yang·· 5 天前精选AI 评分74

通过 On-Policy 上下文蒸馏将智能体经验内化到扩散模型权重中

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI 导读

基于摘要分析。本文研究 Text-to-Image 智能体框架带来的生成收益如何在不运行完整框架时仍部分保留,提出 Diffusion On-Policy Context Distillation(D-OPCD),将智能体改进后的提示作为特权上下文,把其中承载的经验蒸馏进扩散模型权重,使模型仅接收原始查询也能受益。 原问题在于,记忆、技能、工作流编排、结果验证与迭代优化能够帮助智能体不断修订提示,但这些收益通常依赖外部框架持续运行。D-OPCD 的机制重点是把外部上下文带来的能力转化为生成器自身的参数能力。作者同时提出 Auto Skill Evolver(ASE),用于构建具有技能演化能力的 Text-to-Image 智能体。摘要未说明 On-Policy 样本如何采集、教师与学生如何构造、具体损失及训练参数,尚不能据此还原实现。 作者报告,在四个基准上,蒸馏后模型仅使用原始查询进行直接生成,平均评分由 60.52 提升至 65.09。摘要未提供基准名称、评分尺度、各基准结果及聚合方式,因此不能将该评分解释为 Accuracy 或百分比。作者还报告,在更新后的生成器上进行第二轮 ASE,相比不带技能的智能体框架额外提升 1.83 分,并据此提出框架与模型持续协同演化的方向;其长期稳定性仍需进一步验证。 复现应核对基础扩散模型、提示与训练数据来源、技能饱和及移除的判定、蒸馏成本、评估器和对照设置。实验协议、消融及统计信息尚未验证。本文的主要对象是图像生成智能体与扩散模型;摘要未提供 EEG/BCI 数据或神经信号任务证据,不应将所报告的收益视为 BCI 有效性验证。

阅读价值

值得阅读的是其将智能体改进提示中的经验蒸馏进扩散模型权重、再重新演化技能的机制;作者报告了直接生成评分提升,但具体蒸馏目标与评估协议尚需全文核对。

来源:arXiv · 多模态与生成机制 · arxiv.org