跳到正文
OpenReview · Representation learning·· 22 天前精选AI 评分79

强化学习中的终端表示

The Terminal Representation in Reinforcement Learning

AI 导读

基于摘要分析。本文研究强化学习(RL)中的时空抽象,提出 terminal representation(TR),以奖励加权的轨迹编码状态,旨在用更低维的表示支持下游应用,并避免显式特征向量计算。 机制与对照:successor representation(SR)通过状态所诱导的未来轨迹进行编码,将信息流与奖励解耦;default representation(DR)进一步按奖励加权轨迹,将信用分配结构纳入表示。TR 同样编码奖励加权轨迹,但作者称其可作为更低维对象学习,并直接用于 option discovery、reward shaping、transfer learning 和 exploration。摘要指出,相关特征分解处理涉及对称转移动力学假设,而 TR 可以绕过这一限制;具体数学条件及适用范围尚需正文核对。 理论贡献:作者报告给出了 TR 的推导、两种学习算法的收敛性、零样本组合性应用,以及不同奖励表述之间的等价关系。作者还报告,TR 嵌入于 DR 的主特征向量中,因此可在不进行特征分解的情况下捕获相同的底层知识;这一关系的假设与证明细节尚未验证。 实证与局限:作者报告,下游应用实验支持 TR 作为现有表示的可行替代,并称其学习、存储和使用的计算开销更低。摘要未提供具体环境、任务配置、基线、指标或开销数值,实验协议、消融及统计信息尚未验证,不能据此判断收益幅度与适用规模。本文主要研究对象是 RL 表示,而非 EEG 或 BCI;现有材料不足以建立具体的神经信号迁移路径,相关 EEG 工作尚未检索确认。

阅读价值

值得核对 TR 与 DR 主特征向量的理论联系,以及其绕过特征分解、降低表示学习与使用开销的适用条件;这些贡献目前仅有摘要层面的依据。

来源:OpenReview · Representation learning · openreview.net