跳到正文

算法、任务与模态

Reinforcement Learning 最新动态

Reinforcement Learning 研究索引;按可核对的标签归档,不以热度评价质量。

31 条精选近 30 天 16 条共收录 34 条

更新

精选归档 · 第 2 页

5月1日周四第 21–31 条
  1. OpenReview · Representation learning74

    Sliding Puzzles Gym:视觉强化学习中状态表征的可扩展基准

    基于摘要分析。该研究针对视觉强化学习基准难以将表征学习能力与其他学习挑战分离评估的问题,提出 Sliding Puzzles Gym(SPGym),将经典 8-tile puzzle 转化为使用可扩展图像池的视觉 RL 任务。其核心贡献是通过可调网格大小和图像池控制视觉表征难度,为研究表征能力随视觉多样性变化的表现提供评估环境。 机制上,摘要称 SPGym 在保持环境动力学、观测空间和动作空间固定的同时,调节表征学习复杂度。不过,网格大小变化与这些空间保持固定之间的具体实现关系,仍需正文核对。该基准依赖图像构成的拼图观测与 RL 交互任务;图像内容、池规模及训练与测试的分布划分,是解释泛化结果的重要条件。 作者报告,在所评估的 model-free 与 model-based RL 算法中,随着可能出现的图像池扩大,所有受评算法的分布内和分布外表现均下降;复杂表征学习技术也常不及数据增强等较简单方法。这一结果限定于摘要所述实验,不能扩展为所有 RL 方法的普遍结论。具体算法、图像数据集、评价指标、划分协议、消融及统计信息尚未验证,摘要未提供可用于量化比较的数值。 平台推测(待验证):其对 BCI 的潜在启发主要是评估设计,而非直接可迁移的模型——可借鉴将任务规则与输入多样性分开控制的思路,检验 EEG 表征在跨被试或跨会话变化下的稳定性。但 EEG 的低信噪比、通道差异及有限样本与视觉拼图不同,需要重新定义观测、任务和分布变化因素;不能据此认定 SPGym 的结果适用于 EEG。已有 EEG 相关工作尚未检索确认。复现前还需核对环境实现、图像池构建方式、对照配置与代码可用性。

    阅读价值:SPGym 通过控制图像池与拼图规模考察视觉表征能力,值得核对其隔离表征难度的实验设计,以及复杂表征方法与数据增强在相同协议下的比较结果。

10月22日周二
  1. OpenReview · Representation learning74

    Sliding Puzzles Gym:用于视觉强化学习状态表征的可扩展基准

    基于摘要分析。该研究针对视觉强化学习中难以将表征学习与策略学习分开评估的问题,提出 Sliding Puzzles Gym(SPGym)。它扩展经典 15-tile puzzle,通过改变网格尺寸和观测空间来调节表征挑战,同时保持潜在环境动力学与算法问题固定,旨在评估智能体构建组合性、可泛化状态表征的能力。 核心机制是控制任务的潜在结构,并扩展视觉观测的复杂度;观测空间可包含大型真实世界图像数据集。该设计提供了一个研究思路:观察智能体表现如何随表征挑战增加而变化,而不只考察单一视觉条件下的任务表现。不过,网格尺寸变化与固定动力学之间如何协调,以及不同难度下如何控制规划负担,仍需查阅正文确认。 作者报告,实验覆盖 model-free 与 model-based RL 算法,并比较有、无显式表征学习组件的设置;随着表征挑战扩大,SPGym 能区分受测智能体的能力。作者还报告,在更高难度下,没有受测算法能够持续表现突出。摘要未提供算法名称、图像数据集、训练规模、数据划分、评价指标或数值结果,实验协议、消融及统计信息尚未验证,不能据此判断具体算法的优势或泛化边界。 平台推测(待验证):其“固定潜在任务、改变观测难度”的思路可为 EEG 表征评估提供借鉴,但原基准依赖拼图状态和视觉观测,并未验证 EEG/BCI 效果。假设可以构造具有已知潜在状态的 EEG 模拟任务,复用难度分级与受控对照框架,需将图像观测替换为多通道时序,并处理低信噪比、通道差异及跨被试变异。一个可检验的小实验是在固定潜在状态和决策规则下,仅改变模拟 EEG 的噪声水平,比较有、无显式表征模块的状态识别与任务表现;其局限是模拟结构可能不能代表真实 EEG。相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读的具体原因是 SPGym 在保持潜在环境动力学与算法问题固定的同时扩展视觉表征难度,为区分表征学习与策略学习的影响提供了可核对的评估思路,但其隔离效果与实验细节尚未验证。

9月28日周六
  1. OpenReview · Representation learning78

    强化学习中的在线 Laplacian 表示学习

    基于摘要分析。本文研究强化学习中能否在策略更新的同时,在线学习具有理论保证的 Laplacian 表示。作者提出 Asymmetric Graph Drawing Objective(AGDO),并分析在该目标上运行在线投影梯度下降的收敛性质,将图表示学习与持续变化的策略学习过程联系起来。 核心机制是利用底层状态转移图的 Laplacian 矩阵特征向量,将原始状态感知观测编码为有意义的特征。区别于将表示视为固定模块,本文关注策略与图表示同时更新的情形。作者报告,在温和假设及策略学习算法引起的策略漂移有界条件下,在线投影梯度下降具有遍历意义下的收敛性;这不应直接解读为任意策略更新下都能收敛,或每一步表示均收敛。AGDO 的具体形式、投影约束、漂移定义及收敛度量尚未验证。 作者报告,仿真研究支持收敛至真实 Laplacian 表示的理论保证,并讨论不同强化学习算法与在线表示学习的兼容性。摘要未提供环境名称、数据规模、对照基线或量化结果,实验协议、消融及统计信息尚未验证,也无法据此判断样本效率或跨任务泛化的实际增益。 平台推测(待验证):其潜在 EEG/BCI 关联在于为持续变化的闭环交互状态学习图谱表示,但这是一项迁移假设,而非本文已验证的效果。可复用部分是图谱表示目标与在线更新框架;需改造的部分包括 EEG 状态编码、转移图构建及策略漂移控制。原方法依赖状态转移结构,不能将一般 EEG 时间邻接直接等同于强化学习转移图;低信噪比、跨被试与通道差异、小数据下的图估计误差都可能破坏所需条件。一个小规模检验可在固定被试与通道的闭环任务中,对比冻结表示与 AGDO 在线更新,并控制策略变化幅度,观察表示稳定性及任务表现是否随漂移增大而恶化。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读之处在于作者将策略持续更新引起的表示学习目标变化纳入收敛分析,以策略漂移有界为条件讨论在线 Laplacian 表示学习的可行性;具体假设与仿真协议尚待全文核对。

  2. OpenReview · Representation learning71

    策略优化从带噪表征学习中涌现

    研究探讨表征学习网络如何在学习世界表征的同时形成行动策略,提出利用奖励依赖噪声促进策略优化的框架。基于摘要分析,未取得论文全文。 核心机制是让噪声依赖奖励,使表征学习与任务策略优化发生关联。摘要描述网络在提取规范性特征(normative features)与任务相关信息之间取得平衡,但未说明这些特征的操作性定义、噪声注入位置、奖励与噪声的映射关系,以及训练目标和更新规则,因此不能将其直接等同于某种既有强化学习算法。 作者报告,网络的表征变化能够复现若干实验观察到的、随任务学习发生的神经编码变化,并据此提出一种具有生物学合理性的策略优化机制。摘要未列出具体任务、神经记录数据、对照方法或量化指标,尚不能判断复现的覆盖范围与解释力度;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若奖励依赖噪声确实能调节任务相关表征,该机制可能为带反馈的 EEG/BCI 表征学习提供研究假设,但原问题涉及神经系统的学习机制,并不等同于 EEG 解码。迁移需要明确反馈奖励来源、噪声施加模块及任务监督方式;低信噪比、奖励延迟、跨被试差异和小数据可能使额外噪声破坏而非改善表征。一个可检验的小实验是,在固定 EEG 数据划分、编码器和训练预算下,比较无噪声、奖励无关噪声与奖励依赖噪声,检查后者是否带来可重复的解码收益。该实验属于平台提出的迁移检验,不是论文已报告结果;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是其将奖励依赖噪声与表征学习中的策略优化联系起来,并尝试解释任务学习中的神经编码变化;机制细节及其对 EEG/BCI 的适用性尚未验证。

9月26日周四
  1. OpenReview · Representation learning78

    用于强化学习的扩散谱表征

    基于摘要分析。本文针对强化学习(RL)中扩散模型采样推理成本较高的问题,提出 Diffusion Spectral Representation(Diff-SR),将扩散模型用于表征学习,而非在策略优化过程中依赖扩散采样。其核心贡献是利用扩散模型与能量模型的联系,为马尔可夫决策过程(MDP)及部分可观测马尔可夫决策过程(POMDP)的价值函数提取充分表征。 机制与创新:摘要将既有扩散方法的计算瓶颈归因于迭代采样,并提出从表征学习角度利用扩散模型对复杂分布的表达能力。作者称 Diff-SR 能支持高效策略优化及实用算法,同时绕开扩散模型采样的困难与推理成本。这里的“绕开采样”不等于消除全部训练或推理开销;谱表征的构造方式、充分性成立的假设、损失函数及策略优化接口尚未验证。 结果与证据边界:作者报告,在完全可观测与部分可观测设置下的多个基准上,Diff-SR 展现出稳健且有利的性能。摘要未提供具体基准名称、评价指标、对照方法或计算成本测量,因此尚不能量化其性能与效率收益。实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 驱动的闭环 BCI 可建模为 POMDP,Diff-SR 的价值函数表征可能有助于处理观测不完整,并减少在线决策对扩散采样的依赖。但这一路径需要动作、奖励及状态转移轨迹,而非仅有 EEG 分类样本;可考虑复用表征学习与策略优化框架,需改造 EEG 观测编码及历史信息处理接口。低信噪比、跨被试分布变化、通道差异和小规模交互数据可能使表征学习失效。一个可检验的小实验是在固定 EEG 轨迹划分与相同交互预算下,对比 Diff-SR、直接扩散采样策略及非扩散表征基线的任务回报与决策延迟。该设想不代表已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其如何利用扩散模型与能量模型的联系提取价值函数表征,并绕开扩散采样的推理开销;表征充分性的具体条件和效率收益尚需全文核对。

  2. OpenReview · Representation learning76

    强化学习中的离线多任务表征学习

    基于摘要分析。本文研究如何从多个具有共同表征的任务的离线数据中学习共享表征,并提出用于离线多任务表征学习的算法 MORL。其贡献是在低秩强化学习(RL)框架下开展理论分析,并考察所学表征对新任务的作用。 核心设定是上游多个任务与下游新任务共享同一表征。作者进一步分析 reward-free、offline 和 online 三类下游 RL 场景。作者报告,理论结果表明,利用上游离线任务学得的表征,相比直接学习低秩模型的表征具有收益;摘要未给出具体收益界、适用条件或量化结果,因此不能将其解读为已验证的实际性能提升。MORL 的优化目标、算法步骤、离线数据覆盖要求及共享表征的具体形式尚未验证,实验协议、消融及统计信息亦尚未验证。 平台推测(待验证):若某类 BCI 闭环控制问题可以表述为多个共享潜在动力学表征的 RL 任务,该框架或可为离线交互数据的跨任务复用提供理论参照。这里可借鉴的是共享表征学习与下游任务适配的分工,而非将低秩 RL 结论直接套用于 EEG 分类。应用于 EEG/BCI 时,观测编码、任务定义及状态—动作—奖励接口均需适配;低信噪比、跨被试差异、通道变化、小样本和离线数据覆盖不足,都可能使共享表征假设失效。现阶段应先核对理论假设是否匹配目标任务,再评估迁移可行性;相关 EEG 工作尚未检索确认。

    阅读价值:值得阅读其离线多任务低秩 RL 的共享表征学习框架及下游理论分析,但收益所依赖的任务共享假设与数据条件仍需全文核对,尚不能据此推断 EEG/BCI 效果。

  3. OpenReview · Representation learning76

    用于增强强化学习泛化能力的 State Chrono Representation

    基于摘要分析。该研究关注图像输入强化学习中的状态表征泛化问题,提出 State Chrono Representation(SCR),通过在 bisimulation metric 学习的更新步骤中引入更长期的时间信息,增强表征对未来行为的刻画。 核心机制:现有深度 bisimulation metric 方法利用任务相关特征定义状态距离,并从像素观测学习结构化低维表征。作者认为,这类方法在高难度泛化任务和奖励信息不足的场景中,可能因长期信息刻画不足而受限。SCR 在时间框架下联合考虑未来动态,以及当前和长期未来状态的累积奖励,以扩展状态距离学习。作者称,该策略无需为动态建模引入大量额外参数;具体距离定义、损失形式、时间跨度与训练流程尚未验证。 结果与复现:作者报告,在 DeepMind Control 和 Meta-World 环境中的高难度泛化任务上,SCR 优于其他近期基于度量的方法。摘要未提供具体任务划分、基线名称、指标数值或参数开销,因此无法量化收益或比较不同协议。摘要提供了 SCR 代码仓库,但代码内容、运行条件、实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,长期时间结构可能帮助 EEG 表征区分短时观测相似、后续演化不同的状态。原方法依赖带有状态转移及奖励信息的强化学习轨迹,而常见 EEG 任务未必具有对应奖励监督;可考虑复用时间化状态距离的思路,但需改造奖励定义、时间窗口与任务相关监督。低信噪比、跨被试差异、通道变化和小数据可能使距离学习捕获伪相关,长期信息也未必与目标任务有关。一个可证伪的小实验是在固定 EEG 任务与相同被试划分下,对比短时度量表征和加入长期时间信息的表征,保持编码器与训练预算一致,检查跨被试收益是否稳定。该实验仅为迁移建议;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对 SCR 如何将长期动态与累积奖励纳入 bisimulation metric 更新,以及其泛化收益是否依赖奖励信息和轨迹结构;向 EEG 表征学习迁移的价值尚未验证。

1月16日周二
  1. OpenReview · Representation learning79

    正确的 Laplacian 表征学习

    基于摘要分析。本文研究强化学习中的状态表征问题,提出用于近似 Laplacian 表征的新目标函数及配套优化算法,旨在准确恢复图 Laplacian 的特征向量和特征值,避免既有近似方法中的任意旋转及相关超参数依赖。 Laplacian 表征通过图的谱结构编码状态,可用于探索、泛化与迁移,也可为时间扩展动作发现和奖励塑形提供内在奖励。摘要指出,既有适配深度学习的近似目标存在难以高效调节的超参数,且可能收敛到目标特征向量的任意旋转,无法准确恢复对应特征值。作者报告,新方法具有理论保证,并在多个环境中表现出稳健的学习效果;但摘要未提供目标函数形式、优化步骤、环境名称、基线及量化指标,实验协议、消融及统计信息尚未验证。“消除超参数依赖”应限定为摘要所指的既有近似方法依赖,不能解释为整个训练过程无需超参数。 平台推测(待验证):若 EEG 数据能够构造具有可靠邻接关系的样本图,该方法可能用于学习保留谱结构的表征,探索 EEG 表征的稳定性问题。这是假设,原领域效果不等于 BCI 效果。迁移需核对原方法对状态转移数据、图构造和采样规模的要求;可考虑复用谱目标与优化机制,但需改造 EEG 编码器及邻接关系。低信噪比、跨被试差异、通道配置变化和小数据可能使图结构偏离任务相关关系,即便谱恢复准确也未必改善解码。一个可检验的小实验是在固定 EEG 样本图、编码器与被试内划分下,对比既有近似目标和新目标的谱恢复误差、多次训练稳定性及下游解码表现;具体方案须待全文核对后确定。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其目标函数与优化算法如何消除 Laplacian 表征的任意旋转并同时恢复特征值,这直接关系到谱表征的可辨识性与复现稳定性,但具体实验协议尚未验证。

  2. OpenReview · Representation learning81

    面向强化学习的原则性视频表征学习

    基于摘要分析。该研究探讨如何利用视频预训练面向决策的表征,核心目标是恢复底层 MDP 的潜在状态,并从理论上刻画不同噪声条件下的学习难度。研究比较 autoencoding、temporal contrastive learning 与 forward modeling,区分观测中的 iid 噪声,以及具有时间相关性的外生噪声,例如背景中人员或车辆的运动。 理论方面,作者报告:在仅有 iid 噪声的设定下,为 temporal contrastive learning 和 forward modeling 建立了上界,表明这些方法能够学习潜在状态,并支持具有多项式样本复杂度的下游 RL。在同时存在外生噪声的设定下,作者建立下界,说明从视频学习的样本复杂度可能比从带动作标签的轨迹学习呈指数级恶化。该结论针对摘要所述设定,不宜扩展为所有视频预训练方法均无效;定理所需的可辨识性条件、数据生成假设及复杂度依赖项尚未验证。 实验方面,作者报告在两个视觉领域评估了这些表征学习方法,结果与理论发现一致。摘要未提供领域名称、数据规模、划分、对照细节或具体指标;autoencoding 的具体理论结论,以及实验协议、消融及统计信息尚未验证。摘要也未说明实现与复现资源。 平台推测(待验证):若将视频中的潜在状态与外生干扰结构对应到 EEG,本文可为区分任务相关动态与时间相关干扰提供分析视角,但前提是潜在状态及决策结构的假设适用。可借鉴的是噪声分类与表征目标的比较框架;观测建模和决策接口需针对 EEG 改造。低信噪比、跨被试差异、通道变化及小数据都可能破坏状态可辨识性,不能由视觉领域结论推出 BCI 效果。一个可检验的小实验是在可控潜在状态的多通道模拟信号中,分别加入 iid 与时间相关干扰,比较上述表征方法的状态恢复能力,并在明确记录动作的决策设定中加入带动作标签的轨迹对照。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 iid 噪声与时间相关外生噪声的理论区分,以理解视频预训练何时支持高效下游 RL、何时相较带动作标签的轨迹面临样本复杂度障碍;具体定理条件尚待全文核对。

9月22日周五
  1. OpenReview · Representation learning77

    For SALE:面向深度强化学习的状态—动作表征学习

    基于摘要分析。该研究针对强化学习中低层状态表征学习受到较少关注的问题,提出 SALE,通过学习刻画状态与动作交互的嵌入,改善物理控制等任务中的表征。作者将 SALE 与面向 RL 改造的检查点机制集成到 TD3,形成 TD7,并报告其适用于在线和离线设置。 核心机制与创新:不同于摘要所述的图像任务表征学习背景,SALE 面向低层状态,重点是状态与动作之间的交互,而非仅学习状态表示。作者称系统研究了嵌入的设计空间及重要设计因素;但摘要未给出网络结构、监督目标、损失形式、检查点选择规则,也无法据此拆分 SALE 与检查点机制各自的贡献。 结果与证据边界:作者报告,在 OpenAI gym 基准任务上,TD7 相对 TD3 在 300k 和 5M 时间步时的平均性能增益分别为 276.7% 和 50.7%。这些数值是相对性能增益,并非 Accuracy 或百分点变化;具体任务集合、性能汇总与归一化方式、随机种子、统计不确定性,以及这些结果对应的在线或离线协议尚未验证。摘要也未提供离线数据来源及其单独结果。 平台推测(待验证):若 BCI 问题具有明确的状态、动作及反馈轨迹,SALE 的状态—动作交互表示可能用于研究闭环控制策略;这一假设不直接适用于只有 EEG 与分类标签的静态解码数据。可考虑复用交互嵌入思路,但需改造 EEG 状态编码、动作定义与反馈机制。低信噪比、跨被试或跨会话非平稳性,以及小规模交互数据可能使表示学习失效。一个可检验的小实验是在固定 EEG 状态编码、交互预算和评估协议下,对比 TD3、仅加入 SALE 的变体与完整 TD7,并分别观察闭环回报和稳定性;这只是迁移验证建议,不是本文已验证结果。已有 EEG 相关工作尚未检索确认,完整复现条件、消融及统计信息需进一步核对正文。

    阅读价值:值得阅读以核对 SALE 如何建模低层状态与动作的交互,以及其与 RL 检查点机制共同构成 TD7 后的收益来源,但具体设计、消融和评估协议尚未验证。

1月1日周一
  1. OpenReview · Representation learning72

    强化学习中的表征迁移

    基于摘要分析。本文研究强化学习智能体采用不同内部表征时,如何迁移已学习的知识以减少目标端学习时间;核心贡献是定义 representation transfer,将其与 task transfer 区分,并提出两种新算法。 常见 task transfer 利用源任务知识促进相关但不同的目标任务学习;本文则聚焦不同内部表征之间的知识迁移。两类问题的共同目标,是相对于不使用迁移的学习过程缩短目标端学习时间。摘要未说明内部表征的具体形式、两种算法的映射机制、知识载体或训练流程,不能据此将其解释为特定的神经网络表征对齐方法。 作者报告,两种算法已在一个复杂多智能体领域中实现,实验显示不同表征之间的知识迁移具有可行性和收益;作者还报告,representation transfer 算法也可用于 task transfer,从而建立二者的实证联系。摘要未提供领域名称、学习时间指标、收益数值、对照细节或数据划分,实验协议、消融及统计信息尚未验证,尚不能判断收益幅度与适用边界。 平台推测(待验证):其研究问题可启发采用不同 EEG 特征表示的强化学习式 BCI 自适应,但这一假设依赖可对应的状态、动作及奖励结构,不能直接等同于跨被试或跨通道迁移。可复用的是跨表征迁移的研究框架;具体映射模块仍需全文确认,并针对 EEG 的低信噪比、被试差异与小数据条件改造。一个可检验的小实验是在固定任务、动作和奖励定义下,比较两种 EEG 特征表示之间的知识迁移与目标表示从零学习,按相同交互预算评估学习曲线及负迁移风险。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 representation transfer 与 task transfer 的区分及二者的实证联系,但算法机制、学习时间收益与迁移适用条件仍需全文核对。