跳到正文
arXiv · 多模态与生成机制· Houlong Xiong; Zhenqi Qiu; Zechen Wang; Suohang Zhang; Yiyu Ren; Wanting Xu; Hongfei Niu; Chengyang He; Ge Sun; Ran Cheng; Qian Zhu·· 1 天前精选AI 评分79

REACT:面向 VLA 模型反应式机器人控制的滚动去噪与双重解耦

REACT: Rolling Denoising and Dual Decoupling for Reactive Robot Control with VLA Models

AI 导读

基于摘要分析。该研究针对基于流的 vision-language-action(VLA)模型在分块动作控制中的权衡:长动作块有利于平滑执行,频繁重规划则提高响应能力但可能导致动作不连续。REACT 通过滚动去噪保留长期动作上下文,并结合双重解耦支持实时闭环控制。 核心机制是维护带有错开流时间步的持续动作缓冲区,而非每次从噪声重新生成整个动作块。每个控制步利用最新观测对完整预测时域去噪,执行去噪程度最高的动作块,将部分细化的未来动作块向前移动,并在缓冲区末尾补入新噪声。因此,一个动作块在执行前可结合多次近期观测逐步细化。双重解耦进一步将感知、VLM 编码、DiT 去噪和动作执行分离,以在实际算力约束下支持高频观测更新与动作流式输出;具体调度和同步机制尚未验证。 作者报告,在 RoboTwin 2.0 仿真基准及涉及多个机器人平台的真实双臂操作、动态控制任务中,REACT 相比频繁重规划和异步基线提高任务成功率、降低反应延迟,并生成更平滑的轨迹。摘要未提供具体数值、基线名称或评估划分,实验协议、消融及统计信息尚未验证。复现需核对基础 VLA 模型、动作块与缓冲区配置、去噪更新预算、运行硬件,以及反应延迟和平滑性的测量方式。 平台推测(待验证):其可供 EEG/BCI 闭环系统借鉴的是“持续保留未来控制状态、随新观测渐进修正”的控制思想,而非已证实可迁移的 EEG 解码方法。假设适用场景为 EEG 意图驱动的连续辅助控制,需将 EEG 解码输出接入条件更新,并改造动作表示与执行接口;低信噪比、跨被试差异及解码延迟可能使滚动更新积累误差。可在固定解码器和相同计算预算下,对比整段重规划与滚动更新的响应延迟、轨迹平滑性和任务成功率,以检验该假设。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是其以持续动作缓冲区和滚动去噪协调动作平滑性与闭环响应速度的机制,但性能增益及实时调度条件仍需核对全文。

来源:arXiv · 多模态与生成机制 · arxiv.org