面向强化学习的有理论依据的视频表征学习
Towards Principled Representation Learning from Videos for Reinforcement Learning
基于摘要分析。本文研究如何利用视频数据预训练适用于决策的表征,核心目标是恢复底层 MDP 的潜在状态,并分析这些表征能否支持高效的下游强化学习。贡献在于区分 iid 观测噪声与时间相关外生噪声,给出不同条件下的样本复杂度结论。 作者考察 autoencoding、temporal contrastive learning 和 forward modeling 三类常见方法。在仅存在 iid 噪声的设定下,作者报告为 temporal contrastive learning 和 forward modeling 证明了上界:这些方法能够学习潜在状态,并支持具有多项式样本复杂度的下游 RL。摘要未给出 autoencoding 的对应理论结论,也未提供具体损失、模型实现及定理成立的完整假设,尚需正文核对。 对于还包含外生噪声的设定,例如背景中人物或车辆运动造成的非 iid、时间相关变化,作者报告了一个下界:从视频学习的样本复杂度可能比从带动作标签的轨迹学习呈指数级劣化。这是特定理论设定下的困难性结论,不能泛化为所有视频预训练方法必然失效。作者报告在三个视觉领域开展了实验,结果与理论发现一致;领域名称、数据划分、对照基线、指标、消融及统计信息尚未验证。 平台推测(待验证):本文对 EEG 表征学习的启发是区分与任务相关的潜在状态和时间相关干扰,而非直接复用视觉实验结果。迁移假设依赖 EEG 序列中存在可辨识的任务状态及适用的动态模型;可考察 temporal contrastive learning 的训练思路,但需改造信号编码与时间采样。低信噪比、跨被试差异、通道变化及小数据可能使模型优先编码干扰。一个可检验的小实验是在固定被试内划分下,对比加入独立噪声与时间相关干扰后,预训练表征在同一下游任务上的表现变化。该实验仅检验机制假设,不验证原论文的 RL 复杂度结论;已有 EEG 相关工作尚未检索确认。
值得阅读的具体原因是作者以理论上下界区分 iid 噪声与时间相关外生噪声下视频表征学习的可行性,为判断无动作标签预训练何时有助于下游 RL 提供了可核对的条件。
来源:OpenReview · Representation learning · openreview.net