采用联合状态—动作生成的人形机器人世界动作模型
Humanoid World Action Model With Joint State--Action Generation
基于摘要分析。研究针对分层人形机器人控制中的“动作—执行差距”:策略输出的参考动作经过全身控制、机器人动力学、平衡与接触约束后,可能与实际运动不同。作者提出 HWAM,将执行后的本体感知状态作为显式预测目标,联合生成参考动作及其对应的实际身体状态,使动作学习直接获得已执行运动的监督。 核心机制包括三条互补的条件训练路径。Policy 路径仅以当前观测为条件,对状态—动作轨迹联合去噪,与部署时的条件设置相匹配;Forward Dynamics Modeling(FDM)以动作及执行后状态为条件预测未来视觉观测;Inverse Dynamics Modeling(IDM)从视觉变化重建联合轨迹。这些路径共同连接策略参考动作、实际身体运动与视觉结果。相较于摘要所描述的 VLA 和 WAM,关键变化是显式建模执行后状态,而非仅让未来视觉预测同时解释场景变化及动作执行偏差。具体模型结构、损失组合与训练调度尚未验证。 作者报告,在 LimX OLI 人形机器人的三个真实机器人任务上,HWAM 的成功率在所评估基线中最高。其中,在 Candy Picking 任务上,HWAM 的成功率为 70.6%,Fast-WAM 为 43.3%。这些数字限定于该任务与所述机器人评估背景;试验次数、任务划分、数据规模、其他基线结果、统计不确定性及消融信息尚未验证,不能据此推断其他平台或任务上的优势。 平台推测(待验证):其机制可能对应闭环 BCI 机器人控制中“解码指令与实际执行结果不一致”的问题,但不等同于 EEG 解码方法。迁移假设依赖同步的 EEG、参考指令、执行后机器人状态及反馈数据;可复用联合状态—动作监督思想,需要改造观测编码与时序对齐。低信噪比、跨被试差异和小数据可能使联合预测难以稳定学习。可检验的小实验是在固定控制器与相同数据划分下,对比仅预测指令和联合预测指令—执行状态,评估实际执行误差及任务成功率。已有 EEG 相关工作尚未检索确认。
值得关注其将执行后的本体感知状态纳入动作学习的机制,以显式连接策略参考动作与实际运动;摘要报告了真实机器人任务中的优势,但各训练路径的独立贡献尚需全文验证。
来源:arXiv · 多模态与生成机制 · arxiv.org