如何(以及不应如何)在 VLA 后训练中使用数据增强
How (and How Not) to Use Data Augmentation in VLA Post-Training
基于摘要分析。该研究针对 vision-language-action(VLA)模型在较大视觉分布外偏移下泛化不足的问题,系统考察图像增强在强化学习(RL)后训练中的作用。核心贡献是区分增强施加于 critic 与 actor 的效果,并研究增强类型和强度,而非将图像增强统一用于所有模块。 作者报告,有效设置是在 RL 更新阶段仅对 critic 使用图像增强,同时在 rollout 和更新阶段均保持 actor 输入未经增强。针对 π₀.₅ 和 GR00T N1.5,作者报告该设置在 LIBERO-Plus 上分别提高分布外任务成功率 7.8 和 10.0 个百分点;摘要未明确比较基线及具体划分,因此这些增益不能与其他评估协议直接比较。作者还报告,增强 actor 会使训练完全崩溃,但对应增强配置、崩溃判据及统计稳定性尚未验证。 技术阅读重点是:增强是否帮助 critic 学习对视觉扰动更稳健的价值估计,以及为何相同扰动施加于 actor 会破坏训练。上述机制解释仍需正文支持。具体 RL 算法、损失、增强操作与强度、数据规模、分布外偏移构成、实验协议、消融及统计信息尚未验证。 平台推测(待验证):对具有 actor–critic 结构的 EEG 闭环控制系统,可提出“仅增强 critic 输入可能改善对观测偏移的稳健性”这一假设,但图像增强不能直接替代 EEG 的时序、频谱与通道扰动。可复用的是按模块隔离增强的对照思路,需改造的是扰动方式及其生理合理性;低信噪比、跨被试差异、通道变化和小数据可能使增强破坏任务相关信息。一个小规模检验是在固定数据划分、交互预算及 RL 算法下,对比不增强、仅增强 critic、仅增强 actor,并分别评估训练稳定性与跨会话表现。这不构成已验证的 EEG/BCI 效果,已有 EEG 相关工作尚未检索确认。
值得核对其仅增强 critic、保持 actor 输入不变的对照设计:作者报告增强施加位置会显著影响 VLA 的分布外成功率与 RL 训练稳定性,但具体协议及机制解释尚未验证。
来源:arXiv · 泛化与分布偏移 · arxiv.org