跳到正文
arXiv · 多模态与生成机制· Yifan Li; Jiaxu Wang; Dongming Wu; Yicheng Jiang; Ryan Ji; Xiangyu Yue; Yanwei Fu·· 5 天前精选AI 评分74

Vela:通过自适应动作曲线参数化扩展视觉-语言-动作模型

Vela: Scaling Vision-Language-Action Models with Adaptive Action Curve Parametrization

AI 导读

基于摘要分析。Vela 研究视觉-语言-动作模型中固定频率 action chunks 的表示瓶颈,提出以连续轨迹表示未来机器人行为,使固定输出预算能够随运动特征调整时间分辨率,兼顾长时域覆盖与接触密集操作所需的局部精度。 核心机制是将紧凑的样条动作表示、依赖运动的时间支撑范围,以及面向异构机器人形态的共享动作接口结合起来。相较于逐点预测,作者认为该表示可减少相邻高度相关动作对输出容量的占用,并更直接地表达时间连续性与平滑性。摘要未说明样条类型、参数化细节、时间支撑范围的确定方式、训练损失及推理解码过程,这些尚未验证。 作者在大规模、多机器人形态数据上预训练 Vela,并在 LIBERO-X、EBench,以及真实环境中的鸡蛋饼烹饪和土豆切丝两项长时域任务上评估。作者报告仿真与实体操作均取得有前景的结果,但摘要未提供具体指标、数值、数据划分或对照基线,不能据此确认相对优势或收益来源。实验协议、消融及统计信息尚未验证;复现还需核对数据构成、共享动作接口、输出预算设置及模型与代码的可获得性。 平台推测(待验证):若用于 EEG 驱动的连续运动控制,可考虑复用样条动作解码思想,但原方法依赖视觉、语言与机器人动作轨迹,不能直接视为 EEG 解码方法。迁移需改造 EEG 编码器及动作监督接口,并适应信号低信噪比、跨被试差异和小数据条件;曲线压缩也可能抹平短暂但关键的动作变化。一个可检验的小实验是在相同 EEG 输入、数据划分和输出预算下,对照逐点动作预测与样条轨迹预测,分别检查轨迹误差、平滑性及短暂动作保真度。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其连续动作表示如何在固定输出预算下协调预测时域与局部精度,以及这种收益能否通过与固定频率 action chunks 的对照实验得到验证。

来源:arXiv · 多模态与生成机制 · arxiv.org