跳到正文
arXiv · 多模态与生成机制· Shaohan Jiang; Jiahang Cao; Qiduo He; Fengting Deng; Kun Wu; Jingkai Sun; Jiaxu Wang; Qiang Zhang; Qihao Zheng; Chunfeng Song; Ping Luo; Andrew F. Luo·· 5 天前精选AI 评分78

已编码却未掌控动作:揭示视觉-语言机器人策略中的 grounding gap

Encoded but Not in Control: Revealing the Grounding Gap in Vision-Language Robot Policies

AI 导读

基于摘要分析。本文研究语言条件机器人策略中的一个辨识问题:当同一场景允许多种有效动作时,成功执行任务究竟意味着遵循了指令,还是仅从场景推断了任务?作者通过保持场景不变、只修改指令的干预,揭示语言目标已被表征编码却未可靠控制动作选择的 grounding gap,并提出相应诊断框架。 方法上,作者使用有效目标替换、任意名词和无关句子干预指令,在仿真与真实世界实验中评估 vision-language-action(VLA)策略及 world-action models(WAMs)。其中,有效目标替换要求策略转向场景内另一个可见物体,可用于区分指令驱动与场景偏好驱动的行为;其他扰动用于检验语言变化是否影响策略。 作者报告,在要求选择不同可见物体的干预条件下,所有被评估策略仍主要接近并抓取与原场景关联的原始目标。但这并非简单的语言不敏感:指令扰动会影响任务表现,layerwise action lens 显示中间动作预测会响应扰动,线性探针能够准确恢复指令指定的目标。这些观察支持“目标信息可被读取”与“目标信息实际决定动作”之间存在差异。 机制分析方面,作者报告注意力分析显示指令 token 对动作生成的贡献较弱,目标 token 的注意力仍可能集中于原物体;UMAP 与 shared non-negative matrix factorization 分析则显示,目标信息仍可访问,但表征逐渐更多地按场景身份组织。这些结果是作者对编码与视觉 grounding 不匹配的解释,不能仅凭摘要将注意力或探针结果视为完整的因果证明。 具体模型、任务与物体范围、实验数量、成功率、探针训练与数据划分、消融及统计信息尚未验证。复现时值得核对有效替换指令的可执行性、场景与指令目标的对应关系,以及行为指标能否区分抓取成功和目标选择正确。本文主要对象是机器人指令遵循,摘要不提供 EEG 或 BCI 验证,不能据此宣称其诊断框架已适用于神经信号解码。

阅读价值

值得阅读其保持场景不变的指令干预与分层表征诊断框架:作者报告语言目标可被编码却未主导动作选择,提示任务成功率不足以单独验证机器人策略的指令遵循能力。

来源:arXiv · 多模态与生成机制 · arxiv.org