MiniWAM:学习紧凑未来目标以实现高效世界-动作建模
MiniWAM: Learning Compact Future Targets for Efficient World-Action Modeling
基于摘要分析。MiniWAM 针对机器人 World Action Models(WAMs)预测高维原生视觉未来特征所带来的训练成本,提出学习紧凑未来表征,并将其作为与动作预测联合训练的目标。核心贡献是用控制相关的预测表征替代原生视觉未来表征,而不是直接重建全部高维特征。 其目标构建方法 Predictive Representations via Inverse Spatiotemporal Modeling(PRISM)利用训练阶段的特权当前—未来转移信息,将逆动力学监督与特征重建结合,旨在突出与控制有关的转移信息,同时保留有用的未来状态信息。随后冻结 PRISM 编码器,训练 MiniWAM 从当前观测联合预测紧凑目标与机器人动作。具体监督变量、损失形式、目标构造方式及推理输入尚未验证。 作者报告,相比原生未来特征目标,MiniWAM 的目标特征 token 数减少至其 1/65;在采用 DINOv3 和 WAN2.1 VAE 特征的比较中,其表现均优于原生未来特征预测,世界-动作训练最高加速 8 倍。作者还报告,0.25B 参数规模的 MiniWAM 在 LIBERO、LIBERO-Plus 和 RoboTwin 2.0 仿真基准上已能与明显更大的 WAMs 竞争;表征分析显示,PRISM 相比仅使用特征重建提供了额外的行为结构。摘要未给出具体任务分数、数据划分、基线规模或加速所用硬件,实验协议、消融及统计信息尚未验证,不能将这些结果视为跨设置的普遍优势。 平台推测(待验证):迁移假设是,若 EEG 任务具有可靠的时序转移和动作监督,紧凑预测目标可能减少无关信号重建负担;但原方法依赖机器人观测转移及逆动力学监督,不能直接等同于 EEG 解码。可复用的是“先学习目标编码器、再冻结并联合训练”的流程,需改造信号编码器、时间窗口及监督定义。低信噪比、跨被试与通道差异、小数据条件可能使目标偏向伪迹或个体特征。一个可证伪的小实验是在固定被试内划分和相同解码器下,对比原始特征未来预测、仅重建的紧凑目标与加入动作监督的紧凑目标,检验任务指标和训练成本是否同时改善,并核对目标学习数据与测试集隔离。已有 EEG 相关工作尚未检索确认。
值得核对 PRISM 的逆动力学监督如何保留控制相关信息,以及紧凑未来目标相对原生视觉特征预测的效率与性能收益;其 EEG/BCI 迁移价值尚未验证。
来源:arXiv · 表征与预训练 · arxiv.org