$R^2$-WAM:世界动作模型的修复与拒绝后训练
$R^2$-WAM: Repair-and-Reject Post-Training for World Action Models
基于摘要分析。该研究针对世界动作模型(World Action Models,WAMs)中“预测视频视觉上合理,却未忠实反映输入动作”的问题,提出两阶段后训练框架 $R^2$-WAM:先修复动作与预测未来的一致性,再依据预测后果筛选较差动作样本进行负向微调。 核心机制:修复阶段利用观测到的机器人行为,以运动学对齐分数衡量预测运动与示范运动的一致性,使视频预测更可靠地受输入动作约束。拒绝阶段使用修复后的视频模型,比较采样动作与示范动作的预测结果;仅对预测任务进展低于示范参照、且差距达到预设边际的样本实施负向微调。作者称,该流程无需额外环境交互,也不改变推理过程。摘要未提供对齐分数、任务进展度量、边际及负向微调损失的具体定义。 作者报告,在 RoboTwin 2.0 的 clean 与 randomized 设置下,平均成功率为 93.8%;在真实环境的长时程 Fold Shirt 任务上,平均成功率为 87.5%,对照 Fast-WAM 为 0%。摘要未说明试验次数、具体数据划分、设置间汇总方式或不确定性,不能据此判断统计稳健性。实验协议、消融及统计信息尚未验证;复现还需核对基础模型、示范数据要求与训练资源。 平台推测(待验证):其可迁移价值在于先验证条件预测是否忠实于控制输入,再将预测后果用于策略筛选,而非直接把生成质量视为决策质量。若用于 EEG 驱动的闭环 BCI,假设系统具备动作或控制指令、可观测后果及示范参照,可考虑复用两阶段流程,但运动学对齐与任务进展指标需按应用重设。低信噪比、跨被试差异及小数据可能使预测误差被误当作动作质量差异;一个可证伪的小实验是在固定解码器与数据划分下,比较修复前后预测排序与真实反馈排序的一致性。已有 EEG 相关工作尚未检索确认。
值得核对其如何先校准视频预测与动作的一致性,再以示范为参照筛选负向微调样本;该机制为利用世界模型进行策略改进提供了具体路径,但收益的归因与复现条件尚未验证。
来源:arXiv · 表征与预训练 · arxiv.org