跳到正文
OpenReview · Representation learning· Kaixin Wang; Kuangqi Zhou; Jiashi Feng; Bryan Hooi; Xinchao Wang·· 2023-01-01精选AI 评分77

强化学习中的可达性感知拉普拉斯表示

Reachability-Aware Laplacian Representation in Reinforcement Learning

AI 导读

基于摘要分析。本文研究强化学习(RL)中拉普拉斯表示(LapRep)的空间距离能否可靠反映环境状态之间的可达性,并提出通过逐维缩放得到的 Reachability-Aware Laplacian Representation(RA-LapRep),以改善表示距离与可达性的对应关系。 LapRep 是一种任务无关的状态表示,用于编码环境几何结构。既有工作的一个期望性质是:表示空间中的欧氏距离大致反映状态之间的可达性,从而可用于奖励塑形。作者指出,这一性质并非普遍成立:两个状态在 LapRep 空间中距离较小,在实际环境中却可能相距较远,这种不匹配可能妨碍奖励塑形中的学习过程。 RA-LapRep 的核心机制是对 LapRep 的各个维度进行适当缩放,而非仅依赖原始表示的欧氏距离。作者报告,理论解释与实验结果均支持 RA-LapRep 比 LapRep 更好地刻画状态间可达性,并报告奖励塑形性能显著提升、瓶颈状态发现受益。摘要未提供缩放规则、可达性的形式化定义、环境与数据规模、评价指标或数值,因此尚不能判断改进的适用范围与收益幅度;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 状态可以构建具有明确转移意义的图,该方法可能启发对谱表示距离的校准,但环境状态可达性不能直接等同于 EEG 信号相似性或类别可分性。可复用部分是逐维缩放思路,需改造部分是状态定义、转移图构建与监督依据;低信噪比、跨被试差异、通道变化和小样本可能使图结构失真。一个可检验的小实验是在固定被试内 EEG 序列及相同转移图上,对比 LapRep 与 RA-LapRep 的距离对留出转移关系的预测能力,而不预设解码效果会提高。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其对 LapRep 空间距离与状态可达性不一致问题的分析,以及通过逐维缩放修正表示距离的机制;作者报告该修正有益于奖励塑形和瓶颈状态发现,具体实验协议与收益幅度尚未验证。

来源:OpenReview · Representation learning · openreview.net