跳到正文
arXiv · 多模态与生成机制· Jasper Gerigk; Kenzo Aspuru-Takata; Chin-Hsuan Wu; Mohammad Mohammadi; Shuhong Zheng; Igor Gilitschenski·· 2 天前精选AI 评分77

让聆听变得更容易:消除视觉线索以构建无捷径的 VLA

When Listening Becomes Easier: Scrubbing Visual Cues for Shortcut-Free VLAs

AI 导读

基于摘要分析。本文研究 vision-language-action(VLA)模型如何因机器人示范数据多样性有限,将视角、背景等无关视觉特征当作任务捷径,并提出表征层面的诊断指标 action margin 与域对抗训练方法 task scrubbing,以减少视觉捷径依赖、改善分布外泛化。 机制与贡献:作者报告,不同视觉语言模型骨干对视觉捷径的敏感程度明显不同,其行为与 action margin 相关;该指标无需策略 rollout,但摘要未给出计算定义或适用条件。作者报告,视觉捷径会在早期层进入动作表征,不同模型的后续层利用语言信息纠正这些捷径的程度不同。task scrubbing 旨在通过域对抗训练提高模型对语言信息的利用;具体对抗目标、监督信号、训练模块与损失形式尚未验证。 实验与证据边界:作者报告,在涵盖多个 VLA 和视觉线索的仿真及真实机器人实验中,task scrubbing 提高了分布外鲁棒性,并常能消除视觉捷径学习。摘要未提供模型名称、数据规模、数据划分、对照基线或定量指标,因此尚不能判断增益幅度及适用范围。实验协议、消融及统计信息尚未验证;复现还需核对 action margin 的实现、捷径操控方式、训练配置与评估流程。 平台推测(待验证):迁移假设是,若 EEG 解码任务中的被试、会话或采集条件与任务标签存在伪相关,可借鉴其表征诊断与对抗去捷径思路;原领域有效不等于 BCI 有效。可复用的是诊断与干预框架,需改造的是 EEG 编码器、干扰因素定义及监督信号,不能直接照搬 VLA 的语言纠偏机制。EEG 的低信噪比、通道差异和小数据可能使对抗训练误删有效生理信息。可先在任务标签与已知会话因素可区分的数据上,比较干预前后的 Cross-session 表现及表征中的会话可预测性,检验其是否降低干扰依赖且不损害任务信息。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是其用无需策略 rollout 的 action margin 诊断视觉捷径,并通过 task scrubbing 干预语言与视觉信息的利用方式;指标的预测可靠性与干预效果仍需结合全文核对。

来源:arXiv · 多模态与生成机制 · arxiv.org