连接方式至关重要:视觉-语言-动作策略中可供性头的注入拓扑与初始化
Wiring Matters: Injection Topology and Initialization of Affordance Heads in Vision-Language-Action Policies
基于摘要分析。本文研究视觉-语言-动作(VLA)策略中,密集可供性监督如何在提供辅助信息的同时避免损害指令遵循,主要研究对象是 LIBERO 上的机器人策略,而非 EEG/BCI。作者提出让可供性头通过 stop-gradient 读取主干特征,再将该头的中间特征经可学习桥接注入动作专家。 核心机制是隔离辅助任务对主干的梯度影响,同时保留辅助特征参与动作预测的路径。作者报告,在 LIBERO 评估中,允许可供性梯度进入主干时,策略表现为 85.5%,低于不带辅助头的基础策略 93.1%。在保护主干后,作者进行同预算的 2×2 消融,比较拼接与残差两种注入拓扑,以及零初始化与随机初始化两种桥接初始化,认为初始化是主要影响因素。 作者报告,采用主动初始化的残差桥接时,评估表现达到 96.2%,与更复杂的三专家 AffordanceVLA(95.8%)相近,额外参数低于 1%。这些数值均来自摘要所述 LIBERO 比较;具体指标定义、任务汇总方式、数据划分与统计不确定性尚未验证。两项机制探针显示,直接输入真实可供性反而损害表现;推理时将桥接置零的干预则支持作者的解释:惰性桥接主要发挥训练期正则化作用,而主动桥接成为推理时实际依赖的组成部分。 平台推测(待验证):若 EEG 解码系统已有可用的辅助监督,该梯度隔离与特征桥接机制可能用于检验辅助任务是否干扰主任务。可复用的是 stop-gradient、桥接及推理期置零探针,需改造的是信号编码器、辅助目标和任务输出;低信噪比、小样本及跨被试差异可能使桥接学习到不稳定信息。一个可证伪的小实验是在固定跨被试划分和训练预算下,比较无辅助头、直接联合训练及隔离梯度后桥接三种设置,并在推理时置零桥接,以区分正则化收益与实际特征贡献。该假设不构成已证实的 BCI 效果,已有 EEG 相关工作尚未检索确认;原论文完整实验协议、消融及统计信息尚未验证。
该研究通过同预算消融与推理期干预,区分辅助监督的梯度干扰、训练期正则化和推理期实际贡献,值得核对其桥接初始化机制,但对 EEG/BCI 的适用性尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org