基于 Empowerment 的表征学习与技能发现
Representation Learning and Skill Discovery with Empowerment
基于摘要分析。本文研究强化学习中表征学习与无监督技能发现如何联合进行,提出以 empowerment 目标同时优化观测表征和可执行技能,并提供理论分析及新的 actor-critic 架构。 核心机制:摘要将 empowerment 描述为衡量智能体从某种表征出发能够执行的不同技能的最大数量。作者的理论分析指出,如果表征不把具有不同充分统计量的观测合并,可执行的不同技能数量就会增加,因此最大化该目标有助于学习观测的充分统计量表征。为联合学习表征与技能,作者采用相较既有工作更紧的互信息变分下界,并通过新的 actor-critic 架构优化该目标;下界的具体形式、成立条件、技能参数化及训练流程尚未验证。 结果与证据边界:作者报告,在其经验评估中,该方法相比现有无监督技能发现方法能学习显著更多的技能,并能获得适用于下游强化学习的表征。摘要未给出环境、观测结构、基线名称、技能计数标准或下游指标,故无法量化收益,也无法核对“显著”的统计含义。实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 驱动的交互任务具备可执行动作、连续交互轨迹和可区分的结果,该目标可能帮助保留与控制有关的状态信息,而非仅重建观测;这并不等同于已验证的 EEG 分类收益。可考虑复用互信息目标与 actor-critic 优化框架,但需改造 EEG 编码器、技能定义和交互环境。低信噪比、跨被试及通道差异可能使技能区分依赖伪相关,小数据也可能使互信息估计不稳定。一个可证伪的小实验是在固定 EEG 交互任务、数据划分和交互预算下,对照联合目标与仅技能发现目标,检验下游控制表现及跨被试稳定性;已有 EEG 相关工作尚未检索确认。
值得阅读其以 empowerment 联合驱动表征学习与无监督技能发现的理论机制,并核对更紧的互信息变分下界是否带来可复现的收益;摘要未提供具体实验协议。
来源:OpenReview · Representation learning · openreview.net