跳到正文
OpenReview · Representation learning· Amir Esterhuysen; Anders Jonsson·· 6 天前精选AI 评分78

强化学习中的终止表示

The Terminal Representation in Reinforcement Learning

AI 导读

基于摘要分析。该研究针对强化学习(RL)中时空抽象表示的计算与存储开销,提出 terminal representation(TR,终止表示):编码奖励加权的轨迹,同时允许以较低维对象学习,并直接用于下游任务而无需特征向量计算。 机制与对照:successor representation(SR)以状态诱导的未来轨迹编码状态,将信息流与奖励解耦;default representation(DR)进一步用奖励加权轨迹,纳入信用分配结构。作者提出的 TR 与 DR 同样利用奖励加权轨迹,但采用不同的表示结构。摘要指出,既有特征分解路线带有对称转移动力学假设,TR 可绕过这一限制;该说法的适用范围与数学条件仍需核对正文。 理论与结果:作者报告推导了 TR 的理论基础,给出两种学习算法的收敛结果,并分析其零样本组合性及不同奖励表述之间的等价关系。作者还报告 TR 嵌入于 DR 的首要特征向量中,因此可在不进行特征分解的情况下获取相同的底层知识。对于 option discovery、reward shaping、transfer learning 和 exploration 等下游应用,作者报告了支持 TR 可行性的实验证据,并称其学习、存储和使用开销更低。摘要未给出具体环境、数据划分、基线配置、指标或开销数值,实验协议、消融及统计信息尚未验证。 BCI 关联:平台推测(待验证),若 BCI 自适应控制被建模为具有奖励与终止条件的序列决策问题,TR 可能提供降低状态表示开销的路径;这一假设依赖可估计的转移动力学和奖励结构,并非已证实的 EEG 解码收益。低信噪比、跨被试差异及有限交互数据可能影响表示学习与迁移。已有 EEG 相关工作尚未检索确认,当前应优先核对理论假设及原领域实验,再判断迁移价值。

阅读价值

值得核对 TR 如何以较低维表示替代 SR/DR 的特征向量计算,以及其收敛条件与计算开销优势是否在相同下游任务和评估协议下成立。

来源:OpenReview · Representation learning · openreview.net