Vision-Language-Action 模型理解指令吗?关于语言落地的机制可解释性研究
Do Vision-Language-Action Models Understand Instructions? A Mechanistic Interpretability Study on Language Grounding
基于摘要分析。该研究关注机器人 Vision-Language-Action(VLA)模型的动作生成究竟依赖语言指令,还是主要依靠视觉线索与表面相关性。作者对 π₀.₅ 和 GR00T N1.7 开展受控机制可解释性研究,将输入指令扰动与内部干预结合,分析语言信息影响动作生成的位置,以及两种干预分析方法的一致性。 方法上,作者使用 LIBERO benchmark 的输入样本,按同义词替换、semantic scaling、方向性扰动、随机对象替换及空字符串五种策略修改任务指令,并对动作生成模块的残差流实施 activation patching 和 attribution patching。研究不只是观察输出变化,还考察内部表征与干预所揭示的因果效应之间的关系;具体干预实现、样本选择、动作评价指标及统计协议尚未验证。 作者报告,在上述指令扰动条件下,两种模型对抽象改写及不存在对象的指称相对不敏感,而对空任务描述、尤其是方向性语言反应较强。动作生成中的敏感位置存在模型差异:GR00T N1.7 主要集中于较早且周期性出现的交叉注意力层,π₀.₅ 则分布于最早层及部分较晚层。作者还报告,GR00T N1.7 的方向性扰动可产生较大的因果效应,同时内部表征几何相对稳定;π₀.₅ 未清晰呈现这一分离现象。attribution patching 与 activation patching 的结果在 GR00T N1.7 上较一致,但在 π₀.₅ 上并非如此。摘要未提供定量效应量,不能据此判断模型是否普遍“理解”语言。 平台推测(待验证):可迁移的是受控扰动加内部干预的诊断思路,而非机器人模型的结果。在确实含有语言指令、且具备可干预中间表征的 EEG 多模态模型中,可固定 EEG 输入、改变指令并进行激活替换,检验输出是否依赖语言。需改造信号编码器与任务评价,并控制指令和标签的对应关系;低信噪比、跨被试差异、通道变化及小数据可能使干预效果不稳定。一个小规模可证伪实验是比较同义改写、语义冲突与空指令条件下的输出及激活替换效果,观察语言依赖能否稳定重现。已有 EEG 相关工作尚未检索确认。全文中的实验协议、消融及统计信息尚未验证。
该研究通过指令扰动与内部激活干预,检验 VLA 动作生成对语言的实际依赖,并揭示 attribution patching 的可靠性具有模型依赖性,值得阅读其因果干预协议;对 EEG/BCI 的适用性尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org