跳到正文

算法、任务与模态

Reinforcement Learning 最新动态

Reinforcement Learning 研究索引;按可核对的标签归档,不以热度评价质量。

47 条精选近 30 天 25 条共收录 54 条

更新

精选归档 · 第 3 页

1月16日周二第 41–47 条
  1. OpenReview · Representation learning79

    正确的 Laplacian 表征学习

    基于摘要分析。本文研究强化学习中的状态表征问题,提出用于近似 Laplacian 表征的新目标函数及配套优化算法,旨在准确恢复图 Laplacian 的特征向量和特征值,避免既有近似方法中的任意旋转及相关超参数依赖。 Laplacian 表征通过图的谱结构编码状态,可用于探索、泛化与迁移,也可为时间扩展动作发现和奖励塑形提供内在奖励。摘要指出,既有适配深度学习的近似目标存在难以高效调节的超参数,且可能收敛到目标特征向量的任意旋转,无法准确恢复对应特征值。作者报告,新方法具有理论保证,并在多个环境中表现出稳健的学习效果;但摘要未提供目标函数形式、优化步骤、环境名称、基线及量化指标,实验协议、消融及统计信息尚未验证。“消除超参数依赖”应限定为摘要所指的既有近似方法依赖,不能解释为整个训练过程无需超参数。 平台推测(待验证):若 EEG 数据能够构造具有可靠邻接关系的样本图,该方法可能用于学习保留谱结构的表征,探索 EEG 表征的稳定性问题。这是假设,原领域效果不等于 BCI 效果。迁移需核对原方法对状态转移数据、图构造和采样规模的要求;可考虑复用谱目标与优化机制,但需改造 EEG 编码器及邻接关系。低信噪比、跨被试差异、通道配置变化和小数据可能使图结构偏离任务相关关系,即便谱恢复准确也未必改善解码。一个可检验的小实验是在固定 EEG 样本图、编码器与被试内划分下,对比既有近似目标和新目标的谱恢复误差、多次训练稳定性及下游解码表现;具体方案须待全文核对后确定。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其目标函数与优化算法如何消除 Laplacian 表征的任意旋转并同时恢复特征值,这直接关系到谱表征的可辨识性与复现稳定性,但具体实验协议尚未验证。

  2. OpenReview · Representation learning81

    面向强化学习的原则性视频表征学习

    基于摘要分析。该研究探讨如何利用视频预训练面向决策的表征,核心目标是恢复底层 MDP 的潜在状态,并从理论上刻画不同噪声条件下的学习难度。研究比较 autoencoding、temporal contrastive learning 与 forward modeling,区分观测中的 iid 噪声,以及具有时间相关性的外生噪声,例如背景中人员或车辆的运动。 理论方面,作者报告:在仅有 iid 噪声的设定下,为 temporal contrastive learning 和 forward modeling 建立了上界,表明这些方法能够学习潜在状态,并支持具有多项式样本复杂度的下游 RL。在同时存在外生噪声的设定下,作者建立下界,说明从视频学习的样本复杂度可能比从带动作标签的轨迹学习呈指数级恶化。该结论针对摘要所述设定,不宜扩展为所有视频预训练方法均无效;定理所需的可辨识性条件、数据生成假设及复杂度依赖项尚未验证。 实验方面,作者报告在两个视觉领域评估了这些表征学习方法,结果与理论发现一致。摘要未提供领域名称、数据规模、划分、对照细节或具体指标;autoencoding 的具体理论结论,以及实验协议、消融及统计信息尚未验证。摘要也未说明实现与复现资源。 平台推测(待验证):若将视频中的潜在状态与外生干扰结构对应到 EEG,本文可为区分任务相关动态与时间相关干扰提供分析视角,但前提是潜在状态及决策结构的假设适用。可借鉴的是噪声分类与表征目标的比较框架;观测建模和决策接口需针对 EEG 改造。低信噪比、跨被试差异、通道变化及小数据都可能破坏状态可辨识性,不能由视觉领域结论推出 BCI 效果。一个可检验的小实验是在可控潜在状态的多通道模拟信号中,分别加入 iid 与时间相关干扰,比较上述表征方法的状态恢复能力,并在明确记录动作的决策设定中加入带动作标签的轨迹对照。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 iid 噪声与时间相关外生噪声的理论区分,以理解视频预训练何时支持高效下游 RL、何时相较带动作标签的轨迹面临样本复杂度障碍;具体定理条件尚待全文核对。

9月23日周六
  1. OpenReview · Representation learning71

    面向部分可观测强化学习的可证明表征与高效规划

    基于摘要分析。该研究针对真实强化学习中状态信息仅部分可观测、难以直接满足马尔可夫决策过程假设的问题,从表征视角构建学习与规划框架,旨在缓解部分可观测马尔可夫决策过程(POMDP)的计算与统计挑战。 方法与理论:摘要将表征学习作为组织算法设计的核心,并称提出了实际可处理的部分可观测强化学习算法,提供理论分析以论证其统计效率。具体表征如何编码观测历史、如何支持规划,以及理论保证依赖哪些环境、监督或数据规模假设,均尚未验证;不能据摘要确定网络结构、损失形式、训练流程或规划复杂度。 实验与证据:作者报告,所提算法在多个采用部分观测的基准上取得超过当时先进方法的表现。摘要未列出基准名称、评价指标、具体数值或对照配置,因此尚不能判断性能提升的幅度及适用边界。实验协议、消融及统计信息尚未验证,复现所需的实现与计算条件也需查阅全文。 平台推测(待验证):若闭环 BCI 被建模为部分可观测决策问题,该框架可能为利用观测历史估计与控制相关的状态、再进行规划提供方法参考;这是假设,不是已证实的 EEG/BCI 效果。其可复用部分可能是表征与规划的衔接思路,观测编码及状态假设则需针对 EEG 调整。低信噪比、跨被试差异、通道变化和小数据可能破坏表征的稳定性或理论前提。由于摘要不足以确定具体机制,当前不据此制定复现实验方案;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其如何通过表征学习连接部分可观测条件下的学习与高效规划,并核对统计效率保证的假设与适用范围;其对闭环 BCI 的价值尚未验证。

9月22日周五
  1. OpenReview · Representation learning75

    分布式策略评估:用于表示学习的最大熵方法

    基于摘要分析。本文研究分布式 Reinforcement Learning(RL)中的策略评估如何显式考虑状态表示的复杂度,提出 Distributional Maximum Entropy Policy Evaluation(D-Max-Ent PE)框架,并利用其泛化误差界指导状态空间表示学习。 核心机制是将 Maximum Entropy(Max-Ent)框架用于分布式策略评估,推导依赖表示复杂度的泛化误差界,再以 Structural Risk Minimization(结构风险最小化)方式选择表示。作者采用状态聚合函数作为特征函数,提出 D-Max-Ent Progressive Factorization,逐步构建更细粒度的状态表示,在保留信息所对应的偏差与有效状态数、表示复杂度所对应的方差之间权衡。摘要未给出最大熵目标的具体形式、误差界假设、聚合准则或细化停止条件,这些尚需全文验证。 作者报告,示例性数值模拟中的算法表现符合预期理论行为,并展示状态聚合与样本规模之间的关系。摘要未提供具体环境、样本规模、对照方法或定量指标,因此不能据此判断其相对性能或大规模任务适用性;实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设 EEG 驱动的序贯决策问题能构造可用于策略评估的状态、动作、奖励及轨迹数据,这种复杂度约束的状态聚合思路可能用于缓解小样本下状态表示过细带来的估计方差。可复用的是聚合与渐进细化思想,需改造的是 EEG 特征到决策状态的映射及复杂度度量;低信噪比、跨被试或通道差异可能使聚合混合决策意义不同的状态。一个可证伪的小实验是在固定轨迹划分和样本预算下,比较固定粒度聚合与渐进聚合的留出策略评估误差,检验其是否随样本量增加呈现预期权衡。这不构成已验证的 EEG/BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是作者将分布式 RL 中的策略评估误差与状态表示复杂度联系起来,并据此设计渐进状态聚合算法;其理论界的适用条件及数值验证范围仍需全文核对。

  2. OpenReview · Representation learning77

    For SALE:面向深度强化学习的状态—动作表征学习

    基于摘要分析。该研究针对强化学习中低层状态表征学习受到较少关注的问题,提出 SALE,通过学习刻画状态与动作交互的嵌入,改善物理控制等任务中的表征。作者将 SALE 与面向 RL 改造的检查点机制集成到 TD3,形成 TD7,并报告其适用于在线和离线设置。 核心机制与创新:不同于摘要所述的图像任务表征学习背景,SALE 面向低层状态,重点是状态与动作之间的交互,而非仅学习状态表示。作者称系统研究了嵌入的设计空间及重要设计因素;但摘要未给出网络结构、监督目标、损失形式、检查点选择规则,也无法据此拆分 SALE 与检查点机制各自的贡献。 结果与证据边界:作者报告,在 OpenAI gym 基准任务上,TD7 相对 TD3 在 300k 和 5M 时间步时的平均性能增益分别为 276.7% 和 50.7%。这些数值是相对性能增益,并非 Accuracy 或百分点变化;具体任务集合、性能汇总与归一化方式、随机种子、统计不确定性,以及这些结果对应的在线或离线协议尚未验证。摘要也未提供离线数据来源及其单独结果。 平台推测(待验证):若 BCI 问题具有明确的状态、动作及反馈轨迹,SALE 的状态—动作交互表示可能用于研究闭环控制策略;这一假设不直接适用于只有 EEG 与分类标签的静态解码数据。可考虑复用交互嵌入思路,但需改造 EEG 状态编码、动作定义与反馈机制。低信噪比、跨被试或跨会话非平稳性,以及小规模交互数据可能使表示学习失效。一个可检验的小实验是在固定 EEG 状态编码、交互预算和评估协议下,对比 TD3、仅加入 SALE 的变体与完整 TD7,并分别观察闭环回报和稳定性;这只是迁移验证建议,不是本文已验证结果。已有 EEG 相关工作尚未检索确认,完整复现条件、消融及统计信息需进一步核对正文。

    阅读价值:值得阅读以核对 SALE 如何建模低层状态与动作的交互,以及其与 RL 检查点机制共同构成 TD7 后的收益来源,但具体设计、消融和评估协议尚未验证。

5月1日周一
  1. OpenReview · Representation learning71

    学习安全区域的低维表征以实现动力系统的安全强化学习

    基于摘要分析。本文研究高维非线性动力系统中的安全强化学习(SRL),提出数据驱动方法学习安全区域的低维表征,以减少构建合适简化系统模型所需的人工工作,并通过在线反馈更新表征、改善安全估计。 核心机制:摘要所述既有 SRL 框架依赖简化系统模型识别安全区域的低维表征,再向学习算法提供安全估计。本文将该表征的获取改为数据驱动学习,并引入在线适应方法,利用反馈数据更新表征。其贡献重点是安全区域的表征学习与更新,而非摘要中可确认的新强化学习策略或形式化安全证明;具体表征形式、训练目标、反馈信号及安全约束定义尚未验证。 验证与结果:作者以四旋翼为例评估安全区域低维表征的识别效果,并报告相较既有工作,所得表征更可靠、更具代表性,从而扩展 SRL 框架的适用范围。摘要未提供量化指标、数据规模或具体对照名称,实验协议、消融及统计信息尚未验证;不能据此推断具有严格安全保证或已在真实部署中验证。 平台推测(待验证):若用于 EEG/BCI 驱动的闭环控制,可检验的假设是将该表征用于受控设备的动力学安全边界,而非直接将 EEG 状态视为安全区域。可复用的候选模块是安全表征学习与在线反馈更新,需改造的是 EEG 解码输出到控制状态的映射及反馈接口。该路径依赖可观测的系统状态、安全约束和反馈数据,所需监督形式与数据规模仍待核对;低信噪比、跨被试差异、通道变化及小数据可能使状态估计或在线更新失准。小规模实验可在同一闭环仿真任务及固定解码器下,对比冻结表征与在线更新表征,评估安全约束违反情况和任务表现。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以数据驱动安全区域表征替代人工简化建模、并利用在线反馈更新安全估计的机制,但摘要中的四旋翼验证不足以确认其安全保证或 EEG/BCI 适用性。

1月1日周一
  1. OpenReview · Representation learning72

    强化学习中的表征迁移

    基于摘要分析。本文研究强化学习智能体采用不同内部表征时,如何迁移已学习的知识以减少目标端学习时间;核心贡献是定义 representation transfer,将其与 task transfer 区分,并提出两种新算法。 常见 task transfer 利用源任务知识促进相关但不同的目标任务学习;本文则聚焦不同内部表征之间的知识迁移。两类问题的共同目标,是相对于不使用迁移的学习过程缩短目标端学习时间。摘要未说明内部表征的具体形式、两种算法的映射机制、知识载体或训练流程,不能据此将其解释为特定的神经网络表征对齐方法。 作者报告,两种算法已在一个复杂多智能体领域中实现,实验显示不同表征之间的知识迁移具有可行性和收益;作者还报告,representation transfer 算法也可用于 task transfer,从而建立二者的实证联系。摘要未提供领域名称、学习时间指标、收益数值、对照细节或数据划分,实验协议、消融及统计信息尚未验证,尚不能判断收益幅度与适用边界。 平台推测(待验证):其研究问题可启发采用不同 EEG 特征表示的强化学习式 BCI 自适应,但这一假设依赖可对应的状态、动作及奖励结构,不能直接等同于跨被试或跨通道迁移。可复用的是跨表征迁移的研究框架;具体映射模块仍需全文确认,并针对 EEG 的低信噪比、被试差异与小数据条件改造。一个可检验的小实验是在固定任务、动作和奖励定义下,比较两种 EEG 特征表示之间的知识迁移与目标表示从零学习,按相同交互预算评估学习曲线及负迁移风险。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 representation transfer 与 task transfer 的区分及二者的实证联系,但算法机制、学习时间收益与迁移适用条件仍需全文核对。