跳到正文
arXiv · 多模态与生成机制· Kaixi Feng; Guoheng Sun; Ang li·· 4 天前精选AI 评分77

PAIR:衔接视觉-语言-动作模型中的感知与动作

PAIR: Bridging Perception and Action in Vision-Language-Action Models

AI 导读

基于摘要分析。该研究面向将视觉观测和语言指令映射为连续机器人动作的 Vision-Language-Action(VLA)模型,提出 PAIR,通过显式学习共享的感知—动作中间表示,衔接场景与指令表征和动作生成表征,而非主要依赖最终动作预测损失完成这一转换。 训练时,Masked Action Autoencoder 将专家动作片段编码为与预测时域对齐的 Action Latent Tokens;Bridge Module 从当前视觉—语言表示中提取任务相关特征,并将其与动作潜变量对齐,形成兼顾任务信息和专家动作结构的 Bridge Tokens。随后,这些 Bridge Tokens 被投影至动作 token 空间并注入初始 Action Tokens,为 Action Expert 的后续细化提供面向动作生成的起点。推理时移除自编码器,仅根据当前观测与指令生成 Bridge Tokens。摘要未提供对齐损失、掩码策略及训练细节,尚不能确认其具体实现。 作者报告,在 LIBERO、LIBERO-Plus 和 CALVIN ABC-D 上,PAIR 为所评估的 OpenVLA-OFT 与 VLA-Adapter 带来收益。其中,LIBERO-Plus 上 VLA-Adapter 的成功率由 59.1% 提升至 64.2%;CALVIN ABC-D 上其平均完成序列长度由 4.42 提升至 4.53;七项真实世界任务中,OpenVLA-OFT 的成功率由 51.4% 提升至 65.0%。这些指标对应不同任务与评估背景,不能直接横向比较。作者还报告,表示分析显示 Bridge Tokens 保留任务信息,并在 Action Expert 细化前使连续动作信息可被利用。实验划分、试验次数、统计不确定性、消融及复现条件尚未验证。 平台推测(待验证):若 EEG 驱动的连续控制任务具有同步的神经信号与专家动作序列,可假设动作潜变量监督有助于衔接神经表征和控制输出;动作编码与对齐思路可能复用,但需改造视觉—语言编码端及时间对齐机制。该假设依赖可靠的动作监督,可能受 EEG 低信噪比、神经—动作时延、跨被试与通道差异及小数据规模影响。一个可检验的小实验是在固定数据划分、编码器和动作预测器下,对比有无中间动作对齐监督的连续控制误差,再检查跨被试表现。原论文结果不构成 BCI 有效性证据,相关 EEG 工作尚未检索确认。

阅读价值

值得阅读其以专家动作潜变量监督感知—动作中间表示的机制,以及训练期动作编码器在推理期移除的设计;作者报告了机器人任务收益,但其对 EEG/BCI 的适用性尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org