跳到正文
OpenReview · Representation learning· Yunhao Tang; Rémi Munos·· 2023-01-01精选AI 评分78

迈向对 TD-learning 下表征动态的更深入理解

Towards a better understanding of representation dynamics under TD-learning

AI 导读

基于摘要分析。该研究关注强化学习中端到端 TD-learning 如何随训练改变状态表征,以及这种变化如何影响价值预测。其贡献是分析表征动态与价值近似误差、转移矩阵谱分解的关系,并据此提出以随机生成奖励对应的多个价值函数拟合作为表征学习辅助任务。 理论方面,作者报告:在环境满足可逆性条件时,端到端 TD-learning 会使价值近似误差随时间严格下降;在进一步的环境假设下,表征动态可与转移矩阵的谱分解建立联系。摘要未给出这些附加假设、误差定义或分析所用的参数化形式,因此不能将结论推广至任意环境与神经网络训练设置。 方法方面,随机奖励提供了多个价值预测目标,作为学习状态表征的辅助监督。作者报告在表格型环境和 Atari 游戏套件中进行了经验验证,但摘要没有提供具体游戏、对照方法、指标、数值或训练预算;实验协议、消融及统计信息尚未验证,辅助任务的具体损失与实现方式也需查阅全文。 平台推测(待验证):若 EEG 任务包含具有可建模转移结构的连续状态序列,这种多价值函数辅助监督可能用于探索时间结构表征,而非直接替代分类目标。可考虑复用多目标价值预测思路,但需重新定义 EEG 状态、转移与奖励,并核对可逆性等理论条件是否成立。低信噪比、跨被试非平稳性、通道差异及小数据规模可能使转移估计和辅助目标不稳定。一个可检验的小实验是在固定的被试内数据划分与相同编码器下,比较加入和不加入随机奖励价值预测辅助任务的下游性能,同时控制训练预算并避免跨划分构建转移;此建议不代表已证实的 EEG 或 BCI 收益。相关 EEG 工作尚未检索确认。

阅读价值

该研究为 TD-learning 如何改变状态表征提供了带环境假设的理论分析,并以随机奖励下的多价值函数拟合构造辅助任务,值得核对其谱分解联系的适用条件及实验收益。

来源:OpenReview · Representation learning · openreview.net