多种成功路径:以多样性驱动的 RL 微调提升 VLA 泛化
Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization
基于摘要分析。本文研究机器人视觉-语言-动作(VLA)策略经强化学习(RL)微调后,如何提升对微调分布之外任务条件的泛化能力,提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),将成功行为的多样性纳入显式 RL 目标。 作者报告,其分析发现 RL 微调会在全局上收缩行为范围,但同时增加成功轨迹的多样性,以更少的 rollouts 获得成功,并比监督微调覆盖更多潜在的任务有效解空间。作者据此提出,覆盖更多成功行为模式可能为分布偏移提供替代策略;这属于论文的机制解释,不能直接视为普遍成立的泛化规律。 DRIVE 将任务条件匹配的 rollouts 分组,对轨迹进行时间对齐比较,再根据相对行为多样性构造以成功为条件的内在奖励。其设计意图是扩大可行解的覆盖范围,而不奖励多样化的失败行为或仅由执行时序造成的表面差异。具体轨迹表示、距离度量、奖励计算及其与原任务奖励的组合方式尚未验证。 作者报告,在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 的评估中,相较普通 RL 微调,DRIVE 在 π_0 和 π_{0.5} 上的平均分布外(OOD)表现分别提高 5.3 和 2.0 个百分点。在双臂 AgileX PiPER-X 实体平台上,作者报告平均 OOD 成功率由 64.1% 提升至 73.3%,增加 9.2 个百分点。摘要未交代具体分布偏移类型、任务划分、各任务结果及实体实验对照细节,不能据此判断不同协议间的可比性。 复现时需核对成功判定、条件匹配与时间对齐规则、rollout 预算,以及多样性奖励的消融和统计稳定性;实验协议、消融及统计信息尚未验证。本文主要对象是机器人闭环控制,并非 EEG 解码或 BCI;摘要未提供明确的神经信号迁移机制,不据此生成 BCI 复现实验建议。
值得阅读的是其将成功轨迹的多样性转化为显式 RL 目标,并通过任务条件匹配与时间对齐区分有效策略差异和表面时序差异;作者报告了仿真与实体机器人上的 OOD 收益,但其对 EEG/BCI 的适用性尚未验证。
来源:arXiv · 泛化与分布偏移 · arxiv.org