跳到正文
OpenReview · Representation learning· Yunhao Tang; Rémi Munos·· 2023-01-01精选AI 评分79

进一步理解 TD-learning 下的表征动态

Towards a Better Understanding of Representation Dynamics under TD-learning

AI 导读

基于摘要分析。本文研究强化学习中端到端 TD-learning 如何随训练改变状态表征,以及这种变化如何影响价值预测。贡献在于分析特定环境条件下的价值近似误差与表征动态,并从理论联系中提出用于表征学习的辅助任务。 理论方面,作者报告,在环境可逆时,端到端 TD-learning 会使价值近似误差随时间严格下降;在进一步的环境假设下,表征动态可与转移矩阵的谱分解建立联系。这里的可逆性及附加假设限定了结论适用范围,不能据摘要扩展为任意环境、函数近似器或训练配置下的普遍保证。 方法方面,上述谱分析支持将“拟合随机生成奖励对应的多个价值函数”作为表征学习辅助任务。作者报告在表格型环境和 Atari 游戏套件中进行了经验验证。摘要未提供具体环境、奖励生成方式、辅助任务与主任务的组合方式、对照基线或量化结果;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 任务包含连续交互、状态转移和奖励反馈,该机制可能用于考察价值学习能否形成更有用的状态表征,而不是直接替代 EEG 分类方法。可复用的是多价值函数辅助目标;需改造的是 EEG 状态编码、奖励定义和转移建模。低信噪比、部分可观测性、跨被试差异及小样本可能使转移结构不稳定,实际交互环境也未必满足可逆性。一个可检验的小实验是在具有明确动作与反馈的 EEG 交互数据中,固定编码器容量和训练划分,对比加入与不加入随机奖励多价值函数辅助任务的价值预测误差,并检查表征变化是否伴随下游收益。该实验仅为迁移假设,不代表已有 BCI 效果;相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是作者将端到端 TD-learning 的表征动态与环境可逆性、转移矩阵谱分解联系起来,并据此提出随机奖励下的多价值函数拟合辅助任务;其理论适用条件与实验增益仍需全文核对。

来源:OpenReview · Representation learning · openreview.net