跳到正文
OpenReview · Representation learning·· 22 天前精选AI 评分78

从排序到选择:评估强化学习中的表征代理指标

From Ranking to Selection: Evaluating Representation Proxies in RL

AI 导读

基于摘要分析。本文研究强化学习中如何低成本评估预训练表征,核心贡献是指出:代理指标与下游性能的秩相关性不等同于实际模型选择效用,并提出 normalized fraction-of-oracle(NFoO),与秩相关系数 ρ 配合报告。 原问题是,直接评估表征通常需要跨任务、跨随机种子进行昂贵的微调。已有方法使用针对任务相关目标的线性探测,或 effective rank 等表征自身度量作为廉价代理。ρ 衡量整个候选池的排序一致性,而实际选择更关注排名靠前的候选。NFoO 则根据代理所选表征的下游性能,相对于候选池中最佳表征进行评价;具体归一化公式及取值解释尚未验证。 作者扩展了探测目标,覆盖奖励是否出现、多步回报、行为克隆、回合结构、状态转移动态和时间结构。在 Atari benchmark 上,作者评估七种代理指标,分别考察跨预训练方法选择,以及单一游戏内的表征选择,并测试其用于预训练早停的效果。作者报告,在 15 个游戏、超过 20,000 次微调运行的评估中,不同信号对应的代理指标,其排序会随候选池及下游学习器变化,但所选表征的下游表现仍持续较强。因此,作者认为代理指标作为选择器的稳健性,比仅看秩相关性所显示的更高。摘要未提供具体 NFoO、ρ 数值或逐游戏结果,实验协议、消融及统计信息尚未验证。 平台推测(待验证):这一评估思路可能用于 EEG 预训练表征或检查点选择,针对小数据条件下反复微调成本高的问题。可复用的是“排序相关性与选择效用分别评价”的框架;探测目标、下游性能定义和候选池需按 EEG 任务改造。其假设是廉价代理能识别真正可迁移的表征,但低信噪比、被试差异及通道配置变化可能使代理偏向非任务信息。可检验的小实验是在固定跨被试划分与微调预算下,对同一候选池同时比较代理的 ρ、NFoO 及所选模型表现。已有 EEG 相关工作尚未检索确认。

阅读价值

该研究将表征代理指标的整体排序能力与实际模型选择效用区分开来,值得核对 NFoO 的归一化定义及其在不同候选池、下游学习器下的稳定性,但其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net