跳到正文
arXiv · 表征与预训练· Leonardo F. Toso; Yann LeCun; James Anderson; Oumayma Bounou·· 4 天前精选AI 评分78

通过逆动力学保留 JEPA 世界模型中的不稳定模态

Preserving Unstable Modes Through Inverse Dynamics in JEPA World Models

AI 导读

基于摘要分析。本文研究视觉控制中的表征能否保留决定系统稳定性的可控不稳定模态,并提出在 JEPA 世界模型训练中加入动作重建目标,即逆动力学损失,使表征保留控制所需的状态信息。 核心机制与理论:作者指出,下一步预测与防坍塌正则化的组合并不保证保留可控不稳定模态;即使训练损失达到最小,这些模态仍可能被坍塌,导致无法仅依据所学表征实现稳定控制。作者在线性系统条件下证明,精确动作重建使编码器在有限时域可达子空间上具有单射性,因此不能丢弃任何可由 H 步内动作序列到达的状态方向。作者还证明,随着 H 增大,有限时域可控性 Gramian 的主导特征子空间收敛到可控不稳定子空间。这里的保证依赖“精确动作重建”及相应理论条件,不能直接等同于有限数据、近似优化下的保证。 实验与待核对事项:作者报告在 CartPole、Walker2D 和 PointMaze 非线性视觉控制任务上的实验支持上述发现,并展示控制感知表征的益处。摘要未提供具体指标、数值或对照设置;实验协议、消融及统计信息尚未验证。复现时需核对动作重建所使用的时间跨度、输入信息、损失权重,以及重建误差与稳定控制性能之间的关系。 平台推测(待验证):这一机制可启发带有动作或刺激记录的闭环 EEG/BCI 表征学习,假设是预测性能良好并不必然意味着控制相关信息得到保留。可复用的是联合预测与逆动力学约束的思路,但需改造动作定义、时延建模及观测编码器;EEG 的低信噪比、部分可观测性、跨被试差异和小样本可能使动作难以从表征中辨识。可先在具有已知不稳定模态的模拟闭环系统中加入 EEG 式噪声,对比仅预测与加入动作重建的表征,检验模态保留及闭环稳定性,而非直接宣称 BCI 收益。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是其对 JEPA 预测与防坍塌目标不足以保留可控不稳定模态的理论分析,以及逆动力学约束的可核对保证,但精确动作重建假设与实际训练效果之间的差距尚需全文验证。

来源:arXiv · 表征与预训练 · arxiv.org