跳到正文
arXiv · 多模态与生成机制· Seongheon Park; Heecheol Kim; Shulin Tian; Lilika Makabe; Namiko Saito; Katsushi Ikeuchi; Sharon Li; Yasuyuki Matsushita·· 6 天前精选AI 评分73

DiVeR:面向 VLA 测试时扩展的决策关键性验证器学习

DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling

AI 导读

基于摘要分析。研究针对 Vision-Language-Action(VLA)策略中机器人数据成本高的问题,提出 DiVeR:通过候选动作表征的离散程度估计状态的决策关键性,并据此对验证器学习重新加权,使训练更关注动作选择对后续任务结果影响较大的状态。 其推理框架属于验证器引导的测试时扩展:为当前状态采样多个动作候选,再由验证器选择更可能促成任务成功的动作。摘要指出,既有分类式验证器利用轨迹级结果监督,却同等对待沿途访问的状态;许多状态中的合理动作相近,区分信号有限,而少量关键状态允许产生会显著影响后续结果的不同动作。DiVeR 利用动作表征的离散程度作为关键性信号,不需要逐步标注或额外环境交互。具体表征来源、离散程度计算、加权形式及训练目标尚未验证。 作者报告,在 LIBERO、RoboCasa 及 Franka Research 3 机器人的真实环境实验中,DiVeR 通过更有效的验证器引导动作选择持续提升任务成功率,且新增验证器推理开销可忽略。摘要未提供成功率数值、候选数量、对照配置或统计信息,因此不能量化收益,也不能将验证器的新增开销等同于整个多候选推理流程的成本;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移机制是利用候选差异为稀疏关键状态分配更多学习权重,但机器人动作选择与 EEG 解码并不等价。若用于连续 EEG 决策,需要重新定义候选及其表征,并验证表征离散程度反映的是决策重要性而非低信噪比、通道变化或跨被试差异;小数据也可能使权重估计不稳定。可在固定 EEG 任务、数据划分和候选预算下,对比均匀加权与离散程度加权,检验后者是否改善预先指定的解码指标。该实验仅为迁移假设,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 DiVeR 如何用候选动作表征的离散程度识别关键决策状态,并在仅有轨迹级结果监督时改善验证器训练;摘要尚不足以判断收益大小及额外采样成本。

来源:arXiv · 多模态与生成机制 · arxiv.org