回归状态:用于连续控制的显式物理状态世界模型
Back to State: Explicit Physical State World Models for Continuous Control
基于摘要分析。本文研究连续控制中的世界模型:如何在保留 TD-MPC 类方法控制性能的同时,使规划轨迹具有可访问的物理状态语义。作者提出 State TD-MPC(S-TD-MPC),直接传播归一化物理状态,并在每个想象步骤重新计算学习得到的潜在特征,以兼顾显式状态预测与表征能力。 传统 TD-MPC 在潜在空间内学习任务导向动力学并进行短视野规划,但对于基于状态的控制,这使部署阶段难以直接利用预测物理状态定义目标或约束。摘要指出,既有通过重建恢复状态的方法在高维连续控制任务上可能出现明显性能下降;S-TD-MPC 则将显式物理状态保留在动力学传播过程中,而不是仅从潜在轨迹重建状态。 在学习机制上,作者采用基于 MPC 的 Bellman 目标,使价值学习与规划过程对齐,并通过 Bellman 目标界限选择性地重新分析、更新过时的规划器目标。目标的具体计算形式、界限构造及更新条件尚未验证。作者还研究显式状态预测支持的三项能力:共享动力学任务间的零样本迁移、部署时状态约束,以及训练期间的解析奖励计算。 作者报告,在摘要所称的高难度连续控制任务上,S-TD-MPC 的平均回报比最强对照基线高 2.2%,并支持上述约束与迁移能力。摘要未列出任务名称、基线名称、汇总方式及数据划分;实验协议、消融及统计信息尚未验证,因此不能据此判断各任务收益或统计显著性。 原论文对象是基于物理状态的连续控制,并非 EEG 解码或 BCI 验证。平台推测(待验证):其显式状态规划可能用于 BCI 外部设备控制层,但前提是设备状态可观测或可可靠估计;EEG 的低信噪比与跨被试差异并不会由该机制直接解决。已有 EEG/BCI 相关工作尚未检索确认。
值得核对其显式物理状态传播与 MPC 价值目标对齐机制,尤其是作者报告的控制性能保持、部署时状态约束及共享动力学任务迁移能力,但具体评估协议尚未验证。
来源:OpenReview · State space models · openreview.net