跳到正文
arXiv · 多模态与生成机制· Sripad Karne; Arjun Balaji·· 5 天前精选AI 评分78

监控器漏检,机器人执行:VLA 指令中的隐含危害

What the Guard Misses, the Robot Executes: Implied Harm in VLA Instructions

AI 导读

基于摘要分析。本文研究 vision-language-action models(VLAs)执行机器人指令时,外部监控器能否识别以有害目的提出的普通任务。核心设计是保持任务不变,仅改变有害意图的表达显式程度,并结合文本监控与模型激活分析,考察隐含危害是否更容易绕过监控。 作者将所研究的 VLA 描述为无法自行拒绝指令、需依赖监控器筛查有害请求。作者报告,π_{0.5} 在各个意图显式程度下均会完成任务,完成频率与无害对照相当;文本监控器几乎能标记所有直白的有害请求,却较少标记隐含有害意图的请求。在所测试的隐含危害运行中,“任务完成且未触发标记”的比例最高达 95%;即使基于机器人指令重新校准监控器,该比例仍最高达 90%。这些是摘要给出的最高比例,具体任务、监控器、样本量与统计不确定性尚未验证,不宜视为所有机器人场景的普遍失败率。 表征分析方面,作者报告,监控模型激活未能弥合这一差距。线性探针在基础语言模型和视觉语言模型中几乎能够完全区分有害与无害指令,但在两个模型家族中,这种可分性经过机器人训练后减弱,对隐含危害尤为明显。该结果提示需同时检查输入层面的意图识别与机器人训练后的表征变化,但仅凭摘要不能确定训练导致变化的具体机制,也不能将线性可分性直接等同于可靠的运行时拦截能力。 复核时需核对有害意图的构造与标注、固定任务对照的实现、监控器校准及测试划分、线性探针的训练与评估协议,以及任务完成的判定方式;实验协议、消融及统计信息尚未验证。论文主要研究机器人指令安全,并非 EEG 解码或 BCI 控制验证;现有材料不足以提出具体的 BCI 迁移结论。

阅读价值

值得阅读其固定机器人任务、仅改变有害意图显式程度的对照设计,以及机器人训练前后表征可分性的分析;摘要报告了监控盲区,但具体评估协议与泛化范围尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org