面向智能体机器人的递归视频上下文学习
Recursive Video In-Context Learning for Agentic Robot
基于摘要分析。研究针对机器人 LLM 智能体使用文本记忆难以保留操作细节、完整示范视频又增加上下文负担的问题,提出无需训练的 Recursive Video In-Context Learning(RV-ICL)。其核心贡献是将示范视频组织成可由智能体主动访问的层级,而非一次性放入提示,从而支持规划阶段的整体理解与执行阶段的局部细节查询。 方法围绕抓取、释放等示范子事件构建由粗到细的层级,依次涵盖全任务关键帧、阶段、时刻与短片段,并通过只读工具提供访问。智能体规划前读取粗粒度层级;执行中需要更多细节时重新进入层级,仅加载当前子目标对应的片段。该机制旨在缓解固定关键帧遗漏接触细节的问题。摘要称每个任务仅需一段示范;层级构建算法、事件识别方式及工具调用实现尚未验证。 作者报告,在基于 RPent、每个任务使用一段示范的设置下,RV-ICL 将 LIBERO-PRO 上的成功率从 92.6% 提高至 96.5%,将 LIBERO-Plus 上的成功率从 86.7% 提高至 95.8%。摘要未交代完整对照配置、任务划分、重复次数及统计不确定性,不能据此判断提升的稳定性;实验协议、消融及实际上下文开销与延迟尚未验证。 平台推测(待验证):该机制可作为 BCI 辅助机器人系统中的示范检索模块,但并非 EEG 解码方法。假设 BCI 输出可映射为机器人子目标,可复用层级视频存储与按需读取,并需改造子目标映射和错误恢复模块;低信噪比或跨被试指令误差可能导致错误片段检索。可在固定机器人策略与示范条件下,对比固定关键帧和层级检索,并注入不同程度的指令误差,检验任务成功率与检索开销。已有 EEG 相关工作尚未检索确认,机器人基准结果不构成 BCI 有效性证据。
值得核对 RV-ICL 如何以子事件层级和按需片段读取改善冻结 VLA 的机器人任务执行;摘要报告了两个基准上的成功率提升,但层级构建、对照协议及效率收益尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org