TMT:面向未见任务的视觉-语言-动作策略运行时后门检测
TMT: Runtime Backdoor Detection for Vision-Language-Action Policies on Unseen Tasks
基于摘要分析。本文研究视觉-语言-动作(VLA)策略的运行时后门检测:被植入后门的策略可保持正常任务表现,却在触发器出现时产生恶意动作;这些动作单独看可能合理,而未见任务又会带来合法的观测与行为变化。作者提出 TMT,结合 Token Manifold 与潜在 Transition 建模,尝试区分后门激活与任务变化。 机制上,TMT 使用正常行为轨迹训练两个分支,分别评估输入 token 的结构,以及相邻层潜在动态的预测误差。token 流形分支识别出的可疑轨迹,在得到潜在偏差确认后,用于指导后续监测中的 transition 选择。摘要未给出流形表示、预测器、分支融合规则或检测阈值的具体定义,尚不能判断其对不同 VLA 架构的依赖程度。 作者还探索以自蒸馏净化策略:冻结的后门策略提供正常输入下的动作,作为学生策略在配对的正常与带触发器观测上的监督,不需要单独的干净参考策略。该方案依赖配对观测与正常输入动作监督;正常输入下教师动作的可靠性、触发器覆盖范围,以及净化后正常任务表现与残余攻击效果,均需核对全文。 评估方面,作者将传统后门检测器及异常、失败检测方法适配为 VLA 后门检测基线。作者报告,在未见任务上的三种 VLA 后门攻击中,TMT 经与十个基线的事后比较取得最先进的后门检测表现。摘要未提供具体检测指标、数值、任务集、划分或误报情况,无法量化优势,也不能据此外推到其他攻击。实验协议、消融及统计信息尚未验证。 本文的主要对象是 VLA 策略安全,而非 EEG 或 BCI 解码。材料未提供其潜在层动态与神经信号模型之间的具体对应关系,因此不将其结果改写为 BCI 算法效果,也不据此提出 EEG 复现实验;已有 EEG 相关工作尚未检索确认。复现前需核对正常轨迹来源、模型内部表示访问条件、未见任务定义及基线适配方式;摘要虽提供项目页,但代码与模型是否公开尚未验证。
值得核对 TMT 如何结合输入 token 结构与相邻层潜在动态,在未见任务的合法行为变化中识别后门激活,以及其不依赖独立干净参考策略的自蒸馏净化是否存在适用边界。
来源:arXiv · 多模态与生成机制 · arxiv.org