跳到正文
arXiv · 多模态与生成机制· Yonghoon Dong; Minsung Yoon; Jaehyuk Kim; Jungwoo Park; Changyeon Kim; Jinwoo Shin·· 3 天前精选AI 评分80

采用标量伴随匹配的 Q-learning

Q-Learning with Scalar Adjoint Matching

AI 导读

基于摘要分析。本文研究如何通过离策略强化学习微调预训练 flow policy,使其表现超越示范数据,同时降低将最终动作的价值信息反向传播至各个流步骤的计算成本。作者提出 Q-learning with Scalar Adjoint Matching(SQAM),以闭式标量伴随替代逐步的向量–Jacobian 乘积,并结合针对策略生成动作的价值惩罚。 核心机制:flow policy 通过多个流步骤生成动作,传统 adjoint matching 需要在每一步经过策略计算向量–Jacobian 乘积,成本随流步骤数和策略规模增加。作者观察到,预训练 flow policy 的批平均速度场 Jacobian 呈对角集中现象,据此推导按流时间缩放最终动作价值梯度的标量伴随,消除上述逐步乘积计算。作者还指出,在该近似下,控制 critic 对策略生成动作给出的价值尤为重要;摘要未提供价值惩罚的具体形式、近似成立条件或训练细节。 作者报告,在 OGBench 最困难的四个领域中,SQAM 的成功率分别超过各领域最强基线 18–35 个百分点,收益主要集中于这些领域。摘要未给出领域名称、基线身份、绝对成功率及评估划分,不能据此推断其在整个 OGBench 上均有同等提升。作者还报告,在真实双臂机器人上微调大型预训练 vision-language-action policy 时,SQAM 在全部三项任务上优于监督微调,但未提供任务名称、试验次数或提升幅度。 复现与局限:需核对批平均 Jacobian 的结构能否代表单样本及微调过程中的梯度行为,标量伴随与价值惩罚各自的贡献,以及消除向量–Jacobian 乘积后的实际耗时、显存与性能权衡。实验协议、消融及统计信息尚未验证,代码与复现条件亦尚未验证。本文的主要对象是动作生成策略与机器人控制,并非 EEG 解码;材料未提供具体 BCI 对应机制,不据此推断 BCI 有效性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对标量伴随近似能否降低 flow policy 的强化学习微调成本,以及其收益对 Jacobian 结构与 critic 值惩罚的依赖;摘要尚不足以确认其适用边界。

来源:arXiv · 多模态与生成机制 · arxiv.org