解决状态表征失配:用于开环 VLA 规划的状态空间视觉推理
Resolving State‑Representation Mismatch: State‑Space Visual Reasoning for Open‑Loop VLA Planning
基于摘要分析。本文研究视觉-语言-动作(VLA)模型在仅有初始观测的开环规划中,如何内部模拟动作引起的状态转移,提出 State-Space Visual Reasoning(SSVR),将静态视觉上下文、语言约束与循环潜在状态解耦,以支持多步动作预测。 作者将现有推理方式的困难概括为“状态表征失配”:文本推理可能损失空间信息,像素空间推理可能积累视觉生成误差,潜在空间推理则可能绕过中间潜在 token。SSVR 以 Qwen2.5-VL 为骨干,仅编码一次初始图像和指令;随后每一步动作预测均以潜在状态为条件,并通过动作条件化的 GRU 更新该状态。其核心机制是复用静态上下文,同时显式维护随动作演化的紧凑循环状态,而非反复生成完整视觉观测。 作者报告,在 FrozenLake、Maze 和 MiniBehavior 的开环规划评估中,EM/PR 分别为 99.5/99.6、96.3/98.0 和 83.9/90.6,并称优于既有方法。摘要未说明 EM/PR 的具体定义、数值单位、数据划分及对照方法,因而不能据此进行跨协议比较。作者还报告,在前缀缓存已预先构建的条件下,Maze 解码 rollout 相对所评估基线最高加速 98.58 倍;该结果不能直接等同于包含缓存构建成本的端到端加速。 作者称输入变换与迁移设置下的实验支持循环状态建模的有效性,但具体设置、消融及统计信息尚未验证。复现时需核对训练目标、潜在状态初始化与更新实现、长时程误差评估,以及缓存与基线计时口径。 本文的主要研究对象是视觉环境中的开环 VLA 规划,并非 EEG 解码或 BCI 验证。平台推测(待验证):静态上下文与动态状态分离可能为具有明确动作—状态转移结构的 BCI 控制任务提供建模参考,但其依赖的状态可预测性与 EEG 观测噪声之间存在差异,不能将原任务结果视为 BCI 有效性证据;已有 EEG 相关工作尚未检索确认。
值得核对 SSVR 如何通过动作条件化的循环状态更新改善开环多步规划,以及预建前缀缓存条件下的效率收益;其对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net