利用低维策略表征提高离策略 RL 的样本效率
Improving Sample Efficiency in Off-policy RL with Low-dimensional Policy Representation
基于摘要分析。本文研究离策略强化学习(RL)的样本效率问题,提出以低维策略表征辅助价值函数近似,并对训练过程中的邻近历史策略追加价值学习。主要研究对象是连续控制任务,而非 EEG 解码或 BCI。 方法针对由自举、函数近似和离策略学习组成的“致命三角”,着重改进后两项。策略表征作为价值函数的额外输入,旨在减少不同策略之间的近似干扰、改善泛化;对邻近历史策略进行额外价值学习,则旨在促进已学习策略之间的价值泛化。作者将这一路径定位为与改进自举偏差控制相互独立的改进方向。摘要未说明低维表征如何构造、邻近策略如何筛选,以及相应损失和数据复用方式。 作者报告,在连续控制任务评估中,算法的效率和稳定性均获得一致改善。但具体任务、交互预算、对照基线、指标、随机种子及统计信息尚未验证,不能据此量化提升幅度或判断收益来自哪个模块。复现需核对策略表征训练方式、历史策略维护与价值更新规则,以及额外计算成本。 平台推测(待验证):若闭环 BCI 控制任务具备明确的状态、动作、奖励及历史交互数据,策略条件化价值函数可能用于研究有限交互预算下的控制学习;这不等于改善 EEG 表征或解码。可复用的是价值函数的策略条件输入与历史策略学习机制,需改造状态编码和奖励设计。低信噪比、跨被试差异与小数据可能使策略表征和价值估计不稳定。一个可检验的小实验是在含噪闭环控制模拟中,以相同交互预算分别移除这两个机制,比较回报与稳定性。已有 EEG 相关工作尚未检索确认。
值得核对低维策略表征作为价值函数输入、以及对邻近历史策略追加价值学习,是否能在相同交互预算下改善离策略 RL 的样本效率;摘要尚不足以验证表征构造与收益来源。
来源:OpenReview · Representation learning · openreview.net