跳到正文
OpenReview · Representation learning·· 29 天前精选AI 评分77

世界动作模型的表征研究

On the Representation of World Action Models

AI 导读

基于摘要分析。本文研究世界动作模型(World Action Models,WAMs)中,视觉特征及其预测方式如何塑造中间表征,并影响机器人动作预测。作者通过比较不同视觉特征与预测机制,提出 V-JEPA 2.1 特征结合逐帧自回归(frame-wise autoregression)的表征方案;主要研究对象是机器人视觉与动作建模,而非 EEG 或 BCI。 WAMs 利用视觉预测学习全局或密集语义、几何及时空动态等中间表征,再用于动作预测。作者报告,在所研究的机器人动作预测设置中,偏重时空动态的 V-JEPA 2.1 特征优于用于像素重建的 Wan VAE、提供密集语义的 DINOv3 和提供全局语义的 SigLIP-2 特征;逐帧自回归的视觉特征预测也优于 diffusion。摘要未给出各单项对照的完整数值,因而不能仅凭组合结果量化两项选择各自的贡献。 作者报告,在 RoboTwin 2.0 上、不进行额外机器人预训练时,V-JEPA 2.1 + 逐帧自回归方案的平均成功率为 85.9%,Wan VAE + diffusion 基线为 38.0%;额外使用 3,300 小时机器人数据预训练后,两者成功率分别为 91.5% 和 75.1%。这些数值属于相应机器人任务与预训练条件,不能视为 BCI 性能证据。具体任务组成、数据划分、模型配置、计算预算、重复试验及统计信息尚未验证,复现需核对全文中的特征提取、训练与动作预测接口。 平台推测(待验证):可检验的跨领域假设是,与重建观测细节相比,预测任务相关的时序潜在特征可能更适合 EEG 表征学习。原方法依赖视觉特征及机器人数据,不能直接照搬 V-JEPA 2.1;可借鉴特征预测目标与逐步预测机制,但需改造 EEG 编码器、通道表示及下游任务接口。低信噪比可能使预测目标偏向伪迹,被试和通道差异可能破坏潜在空间一致性,小数据也可能限制自回归训练。一个小规模可证伪实验是在同一 EEG 数据集、固定编码器和训练预算下,比较潜在时序特征预测与信号重建目标,并分别报告被试内和跨被试任务表现。已有相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是对视觉特征选择与预测方式如何影响机器人动作预测的对照分析,但其对 EEG/BCI 表征学习的价值尚未验证。

来源:OpenReview · Representation learning · openreview.net