跳到正文
arXiv · 多模态与生成机制· Xilun Zhang; Maggie Wang; Erik Bauer; Hong-Xing Yu; Huang Huang; Jiajun Wu; Marco Pavone·· 3 天前精选AI 评分76

在部署过程中协同演化机器人编排器与策略

Co-Evolving Robot Orchestrators and Policies through Deployment

AI 导读

基于摘要分析。本文研究机器人部署中视觉-语言-动作(VLA)策略泛化不足,以及策略更新后与既有视觉-语言模型(VLM)编排器失配的问题,提出 Robo-COP,让编排器与策略在部署过程中协同演化。研究对象是机器人任务执行,并非 EEG 解码或 BCI。 核心机制:编排器决定何时调用策略、如何给出指令,以及何时使用脚本技能;Robo-COP 从自身执行中整理技能示范,当这些数据能够针对反复出现的失败时微调策略,并仅在新策略改善其训练目标技能后采用该版本。相较围绕冻结策略构建的系统,作者希望通过更新策略突破其能力瓶颈,同时避免单独微调导致编排器与策略行为脱节。具体示范筛选规则、更新触发标准、验证阈值、损失函数及编排器如何更新,尚未验证。 结果:作者报告,在十项模拟 RoboLab 任务的留出评估中,Robo-COP 将平均成功率从相同编排框架搭配冻结策略时的 64.8% 提升至 73.8%;按固定日程微调且不进行验证的对照为 65.8%。在三项真实机器人任务的留出评估中,作者报告成功率从 38.3% 提升至 50.0%,但摘要未明确该组基线的配置。这些结果不能直接与 BCI 的 Accuracy 或其他指标比较。留出划分、试验次数、统计不确定性、消融及计算成本尚未验证。摘要称已提供视频与代码,复现所需权重、数据和运行条件仍需核对。 平台推测(待验证):可迁移的假设是“更新候选模型后先验证、再部署”的协同管理机制,而不是 VLA 本身。若闭环 BCI 具有可靠任务反馈,可探索解码器更新与交互控制器同步调整;需将机器人技能示范替换为神经信号及可信监督,并改造验证门槛。低信噪比、跨被试差异、通道变化和小样本可能使自采集数据强化错误,机器人原领域结果不构成 BCI 有效性证据。一个可证伪的小实验是在固定数据预算与独立留出会话下,离线比较冻结解码器、定期微调及验证后采用更新三种方案,检查后者是否稳定改善预先指定的解码指标。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其部署数据筛选、策略更新触发与更新后验证机制:摘要中的对照提示,策略微调的收益可能取决于它与编排器的协同,而非仅增加训练频率;其 BCI 适用性尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org