跳到正文
arXiv · 多模态与生成机制· Yutian Zhang; Xingrui Xiong; Siyuan Ma; Yang Li; Jiawen Wen; Jiaqi Zhai; Liwen Yang; Ce Hao; Haozhen Chi; Yangkun Zhu; Yifan Zhu; Xiaowen Chu; Dong Wei; Qiaojun Yu; Dibo Hou·· 4 天前精选AI 评分78

VOMMI:移动操作便携式示范的采集与利用

VOMMI: Collecting and Leveraging Portable Demonstrations for Mobile Manipulation

AI 导读

基于摘要分析。该研究面向具身智能中的移动操作示范数据稀缺问题,提出 Visual-Odometry-Conditioned Mobile Manipulation Interface(VOMMI),通过离线轨迹重建与在线视觉运动条件化,将无需机器人参与采集的便携式 RGB 示范用于 vision-language-action(VLA)模型的后训练。主要研究对象是机器人导航与局部物体交互,而非 EEG 或 BCI。 机制上,VOMMI 同步采集身体视角和手部视角,分别提供导航上下文与局部交互信息,无需进行人机运动学对应关系标定。R2-VO 使用稀疏几何锚点细化离线示范轨迹,并生成覆盖多个预测时域的因果局部运动 tokens,用于在线策略条件化。action-group residual adapter 仅将这些 tokens 注入底盘动作分支。摘要未披露几何锚点的获取方式、具体损失函数、训练配置及因果性实现细节,尚需正文核对。 实验方面,摘要描述每个任务使用 500 条便携式示范轨迹,其中留出 75 条用于 RGB-VO 评估,并以 200 条机器人示范作为参考。作者报告,仅使用便携式示范后训练的策略,相比使用机器人采集示范训练的策略,底盘速度误差降低 18.2%,同时保持相近的末端执行器平移精度。离线重建相对于身体与手部各自评估中表现最好的基线,使两路绝对轨迹误差平均降低 24.6%。在三个真实机器人任务上,完整系统相对 OpenPI 0.5 的平均成功率提高 8.3 个百分点。任务内容、误差单位、成功率统计及上述比较的详细训练与评估协议尚未验证。 该方法依赖同步 RGB 视角、视觉里程计和稀疏几何约束,不能直接等同于神经信号中的运动监督。当前材料未提供这些机制与 EEG 瓶颈的具体对应关系,因此不据此提出 BCI 迁移效果或复现实验建议;相关 EEG 工作尚未检索确认。复现仍需核对采集装置、锚点来源、VLA 后训练流程、消融与统计信息,以及代码和数据的可用性。

阅读价值

值得阅读的是其将离线轨迹纠偏与在线运动条件化分离、并仅对底盘动作分支注入运动信息的设计,但机器人任务中的作者报告结果尚不能作为 EEG/BCI 有效性的证据。

来源:arXiv · 多模态与生成机制 · arxiv.org