跳到正文
OpenReview · Representation learning· Scott Fujimoto; Wei-Di Chang; Edward J. Smith; Shixiang Gu; Doina Precup; David Meger·· 2023-01-01精选AI 评分77

For SALE:面向深度强化学习的状态—动作表征学习

For SALE: State-Action Representation Learning for Deep Reinforcement Learning

AI 导读

基于摘要分析。本文研究强化学习(RL)中低层状态的表征学习,主要面向物理控制等任务,而非 EEG 或 BCI 信号解码。作者提出 SALE,通过学习状态与动作交互的嵌入表示改善表征,并将其与适用于 RL 的检查点机制结合、集成到 TD3 中,形成 TD7 算法。 机制与创新:相较于主要面向复杂图像输入的表征学习,SALE 关注低层状态及其与动作的关系。摘要说明作者系统考察了嵌入的设计空间,但未提供嵌入结构、监督目标、损失形式及更新流程;检查点的保存、选择和恢复规则也尚未验证。因此,不能仅凭摘要将 TD7 的整体收益归因于 SALE 单一模块。 结果:作者报告,在 OpenAI gym 基准任务上,以 TD3 为对照,TD7 在 300k 与 5M 时间步时的平均性能增益分别为 276.7% 与 50.7%;作者同时报告该算法适用于在线与离线设置。摘要未交代具体任务集合、性能定义、增益汇总方式,也未明确上述数值分别对应哪些在线或离线协议,不能将其解释为 Accuracy 提升或跨设置通用结论。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 BCI 任务涉及连续闭环控制,且具备状态、动作、奖励及后继状态构成的交互数据,SALE 的状态—动作联合表征可能具有可复用价值;这不等同于已验证的 EEG 解码效果。可考虑保留 RL 表征与策略学习框架,将状态输入改为 EEG 解码特征,但需处理低信噪比、跨被试和跨会话漂移,以及小数据条件下交互表征不稳定的风险。一个可检验的小实验是在同一闭环控制模拟任务、相同交互预算和随机种子下,对照 TD3 与加入 SALE 的版本,固定检查点规则,比较回报及状态噪声扰动下的稳定性。相关 EEG 工作尚未检索确认;具体复现仍需核对全文中的任务、训练设置及实现条件。

阅读价值

值得核对 SALE 如何建模低层状态与动作的交互,以及其与 RL 检查点机制各自对 TD7 性能的贡献;摘要报告的增益尚需结合任务汇总方式与实验协议验证。

来源:OpenReview · Representation learning · openreview.net