NegaAlign:视觉语言动作模型的否定约束适配
先了解这件事
基于摘要分析。NegaAlign研究视觉语言动作模型如何完成操作目标并遵守明确排除约束。方法在视觉—语言骨干中插入否定变换层,结合教师引导的视觉token对齐;利用现有示范构建图像—语言监督,仅更新插入层,冻结包括动作生成器在内的预训练参数。 作者报告,NegaBench涵盖五个领域、10个仿真场景,GR00T、π₀及π₀.₅均有改善。使用11.6M可训练参数时,π₀.₅的否定指令成功率在NegaBench上由2.60%升至88.45%,真实任务中由12.4%升至88.8%,并保留肯定指令性能。 平台分析:两组成功率属于不同环境,不宜横向比较;数据划分、真实任务数量、成功判据、对照、消融及统计信息尚未验证,教师构建与损失细节亦尚未验证。本次新增材料未提供可核对的版本变化;结果不构成EEG或BCI场景中的有效性证据。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv · 在线与高效推理精选告诉机器人不要做什么:否定理解视角
基于摘要分析。研究关注 vision-language-action models(VLAs)如何在完成机器人操作目标的同时,遵守自然语言指令中的明确排除约束。作者提出参数高效、即插即用的 NegaAlign,通过图像—语言监督扩展预训练 VLA 的否定指令理解能力,并提出用于评估此类操作的仿真基准 NegaBench。 机制方面,NegaAlign 在视觉—语言骨干的选定层插入 Negation Transformation Layers,以重塑中间指令表征;同时使用教师引导的对齐机制,对齐与指令相关的视觉 tokens,从满足否定约束的指令中迁移动作相关的 grounding。训练监督由现有示范构建,仅更新插入层,所有预训练参数均冻结,包括动作生成器。摘要未提供教师构建方式、具体损失、插入位置及监督样本生成细节,这些内容尚未验证。 作者报告,NegaBench 覆盖五个领域的 10 个仿真场景,在 GR00T、π_0 和 π_{0.5} 上均观察到否定指令执行改善。其中,具有 11.6M 可训练参数的 NegaAlign 将 π_{0.5} 在 NegaBench 上的否定指令成功率从 2.60% 提升至 88.45%,在真实世界任务中从 12.4% 提升至 88.8%,并保留肯定指令上的性能。两组成功率对应不同评估环境,不宜直接横向比较;数据划分、真实任务数量、成功判据、对照配置、消融及统计信息尚未验证。 平台推测(待验证):该方法可为带自然语言约束的 BCI 辅助机器人控制提供参考,但其监督依赖图像、语言与机器人示范,并非直接面向 EEG 解码。若引入 BCI 系统,可考察冻结动作模型的约束适配模块,但需改造脑信号到指令或控制意图的接口;低信噪比、跨被试差异及小数据可能使意图误差传递为约束执行错误。一个可检验的小实验是在固定机器人任务中比较正确指令与含受控解码错误的指令,分别测量任务成功率和约束违反率。相关 EEG/BCI 工作尚未检索确认。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。