跳到正文
arXiv · 多模态与生成机制· Mingyu Liu; Chonghao Sima; Tianjian Feng; Hanqing Wang; Cong Chen; Hao Chen; Chunhua Shen·· 6 天前精选AI 评分73

PerturBot:通过扰动式训练打破视觉—语言—动作模型中的捷径先验

PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training

AI 导读

基于摘要分析。本文研究视觉—语言—动作(VLA)策略虽能完成任务,却可能依赖视觉、词汇或动作中的捷径而忽略决策所需证据的问题。作者提出 Perturbot,通过调整训练数据中的视角、指令与轨迹内容削弱捷径,同时提出离线指标 GroundingFscore,用于区分任务成功与对任务证据的依赖。 核心机制:作者将成功示范中足以预测专家动作、却不必支持正确决策的规律称为 modality shortcuts。例如,腕部相机附近的物体可能取代指令指定的目标;熟悉的名词可能在动词改变后仍触发训练中配对的操作;夹爪未抓到物体也可能继续抬升。Perturbot 采用保持任务不变的腕部视图扰动,以与决策相关的描述扩充指令,并加入随机及失败轨迹片段,按片段实际包含的行为重新标注。其思路不是仅增加同类成功示范,而是改变扩充数据的内容;摘要说明推理流程保持不变。 评估与证据边界:作者提出以任务成功率衡量策略表现,以 GroundingFscore 诊断策略对模态捷径的依赖程度。摘要未提供该分数的计算公式、模型与数据集、训练规模、评估划分或定量结果,因此尚不能判断干预收益及指标有效性。实验协议、消融及统计信息尚未验证;复现需核对任务保持条件、轨迹重标注规则,以及诊断指标与实际行为之间的对应关系。 平台推测(待验证):其机制可能启发 EEG 解码中对伪迹、会话特征等捷径的诊断,但原方法依赖多模态指令与可重标注行为轨迹,不能直接视为 EEG 方法。可复用的是任务保持扰动与独立捷径诊断的思路,需改造信号扰动和标签保持条件;低信噪比、小数据及跨被试差异可能使扰动同时破坏有效神经信息。一个可检验的小实验是在固定 Cross-session 划分下,对比常规训练与经核验的标签保持扰动训练,分别检查解码表现和对候选伪迹的敏感性。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是作者将 VLA 的任务成功与任务证据依赖分开评估,并提出不改变推理流程的训练干预;其诊断分数能否可靠识别捷径、干预是否改善泛化,尚需全文实验验证。

来源:arXiv · 多模态与生成机制 · arxiv.org