跳到正文
OpenReview · State space models· Akshay Mete; Shahid Aamir Sheikh; Tzu-Hsiang Lin; Dileep Kalathil; Panganamala Kumar·· 2026-07-31精选AI 评分77

Optimistic World Models:深度 MBRL 中的模型空间探索

Optimistic World Models: Model-Space Exploration for Deep MBRL

AI 导读

基于摘要分析。本文研究基于模型的强化学习(MBRL)中的高效探索问题,提出 Optimistic World Models(OWM),通过修改世界模型训练目标开展模型空间探索,而非仅在策略空间中增加探索激励。 作者将现有深度 MBRL 探索方法概括为主要依靠熵正则化、新颖性奖励或集成分歧,同时指出经典 optimism-in-the-face-of-uncertainty(OFU)方法虽在模型空间实施探索,却受规划成本及不确定性估计需求限制。OWM 在标准世界模型训练中加入两项:一是基于 Reward-Biased Maximum Likelihood Estimation(RBMLE)原则的乐观动力学损失,使学习到的状态转移偏向高回报结果;二是模型熵正则项,在乐观性信号较弱时辅助探索。作者称,乐观动力学损失利用想象回报相对于模型参数的闭式梯度,缓解 OFU 的计算困难,且不需要辅助网络、集成模型或后验估计机制。具体损失形式、梯度推导及正则项权重尚未验证。 作者报告,在 DreamerV3 上实现 OWM 后,Atari-26 benchmark 的汇总人类归一化得分提高 10%,并在困难探索游戏 Private Eye 上取得明显收益。该数字是汇总得分的相对提升,不是 Accuracy 或百分点;摘要未明确参照基线、交互预算、聚合方式、随机种子及统计不确定性,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 驱动的闭环 BCI 可建模为具有动作、反馈奖励与时序状态的交互过程,模型空间探索可能对应反馈稀疏条件下的策略学习瓶颈。可考虑复用训练目标,但需改造 EEG 状态表征、奖励定义及安全动作约束;普通离线 EEG 分类并不直接满足其机制前提。低信噪比、跨被试差异和少量交互数据可能使乐观偏置放大动力学误差。可检验的小实验是在固定被试内划分与交互预算的模拟闭环任务中,对照同一世界模型有无 OWM 目标,同时比较累计回报与转移预测误差。已有 EEG 相关工作尚未检索确认,原领域收益不构成 BCI 有效性的证据。

阅读价值

值得核对 OWM 如何通过世界模型训练目标而非仅策略探索促进高回报轨迹发现,尤其是想象回报梯度的计算方式及其对模型预测准确性的影响;摘要中的 Atari-26 收益尚需结合完整实验协议验证。

来源:OpenReview · State space models · openreview.net