跳到正文

算法、任务与模态

Reinforcement Learning 最新动态

Reinforcement Learning 研究索引;按可核对的标签归档,不以热度评价质量。

189 条精选近 30 天 36 条共收录 234 条

更新

精选归档 · 第 10 页

11月1日周五第 181–189 条
  1. OpenReview · State space models81

    利用状态—动作等价性的基于模型的强化学习

    该研究关注转移分布未知的 Markov Decision Process(MDP),提出利用状态—动作对之间的等价结构共享统计信息,以改善基于模型的强化学习置信界与遗憾表现。基于摘要分析,未取得论文全文。 核心机制是通过不同状态—动作对的转移概率相似性定义等价结构。当学习者预先知道该结构时,作者给出等价结构感知的置信界,并报告其可证明地比不利用等价结构的对应置信界更紧。对于结构未知的情形,作者提出 ClusteringAlgo,寻找近似等价结构,再据此构造置信界;具体相似性定义、聚类准则及误差处理尚未验证。 作者将上述机制用于 CUCRL,作为 UCRL 在无折扣 MDP 中的修改版本。作者报告:在等价结构已知、具有 S 个状态、A 个动作和 C 个等价类的 communicating MDP 中,相较 UCRL,CUCRL 的遗憾界获得 √(SA/C) 倍的改进;该结论对应已知结构的理论条件,不能直接外推至结构未知的情况。对于未知结构,作者报告 CUCRL 与 ClusteringAlgo 结合在 ergodic MDP 的数值实验中优于 UCRL,但摘要未给出具体实验规模、数值指标或统计信息。 平台推测(待验证):这一机制可能适用于具有重复转移规律的 BCI 自适应交互决策,而非直接作为 EEG 表征学习方法。假设多个状态—动作对确有稳定的转移等价性,可复用置信界和聚类思路;需改造的是神经信号到离散状态的映射,以及等价关系在不同被试和会话中的检验。EEG 低信噪比、小样本及状态非平稳性可能导致错误合并,使统计共享失效。一个可证伪的小实验是在具有可控等价结构的模拟 BCI 交互 MDP 中,固定交互预算,比较 UCRL 与 CUCRL,并逐步扰动等价关系,检查累计遗憾及置信界覆盖率。该实验仅检验机制迁移假设;已有 EEG 相关工作尚未检索确认。完整理论条件、实验协议、消融及统计信息尚未验证。

    阅读价值:值得核对其利用状态—动作等价结构收紧转移概率置信界的理论机制,尤其是已知结构下的遗憾改进与未知结构下聚类误差的影响;摘要未提供 EEG 或 BCI 有效性证据。

1月1日周二
  1. OpenReview · State space models74

    利用地标映射状态空间以实现通用目标到达

    基于摘要分析。该研究面向大规模、稀疏奖励的马尔可夫决策过程(MDP),解决 Universal Value Function Approximator(UVFA)难以准确估计远距离目标价值、进而导致策略失败的问题。核心贡献是将已访问状态空间组织为动态地标地图,用高层地图支持远距离路由,用低层价值网络生成精细的局部决策。 UVFA 预测各状态—目标对之间的累积奖励。论文提出层级化环境表示,并从历史经验中通过 farthest point sampling 选择地标状态,以增强状态空间覆盖。作者报告,相比简单均匀采样,该选择方式改善了探索;在若干具有挑战性的任务中,该方法使智能体在训练早期即可到达远距离目标,并取得优于标准 RL 算法的表现。摘要未给出任务名称、具体基线、指标或数值,因此不能判断收益大小及适用范围。 需要核对的技术细节包括地标间连接与路由规则、地图更新机制、局部价值网络的训练目标,以及高低层决策的衔接方式;实验协议、消融及统计信息尚未验证。复现还需取得环境配置、经验采样流程和训练实现。这里的状态空间指强化学习环境的状态集合,不能据来源栏目将其视为序列建模中的 State Space Model。 平台推测(待验证):假设 BCI 闭环控制任务具有可重复访问、距离有意义且局部可达性相对稳定的状态表示,地标路由与局部控制的分工可能对应稀疏反馈下的长程目标控制瓶颈。可复用的是地标选择及层级规划思路;需改造的是神经信号到控制状态的表示与距离定义。低信噪比、跨被试差异、通道变化和小数据可能使地标距离偏离实际可达性,导致地图失效。一个可检验的小实验是在固定解码器的 BCI 控制仿真中,保持训练预算和低层控制器一致,对比地标规划、均匀地标采样与不使用高层地图的方案,评估远距离目标到达率及噪声敏感性。已有 EEG 相关工作尚未检索确认,该假设不代表已证实的 BCI 效果。

    阅读价值:值得阅读其以地标地图承担远距离路由、以局部价值网络细化决策的层级分工,但摘要中的性能结论及其向 BCI 控制任务迁移的有效性仍需验证。

9月17日周一
  1. OpenReview · State space models74

    通过扩展感知运动空间实现发展式强化学习

    基于摘要分析。该研究面向连续感知运动空间中的无模型深度强化学习,提出受儿童发展启发的迁移学习方式:让智能体在学习策略的过程中逐步扩大可用的感知运动空间,而非一开始就在完整空间中搜索。 核心机制是在基于神经网络的 actor-critic 中加入 developmental layers,依据 Intrinsic Motivation 启发式逐步开放部分感知运动维度。为缓解空间扩展过程中的灾难性遗忘,作者借鉴 Elastic Weight Constraint 调节神经控制器的学习。摘要未给出维度开放规则、约束的数学形式及训练调度,不能据此确定具体网络结构或损失函数。 作者报告,在 DDPG 和 NFAC 两种算法以及 Half-Cheetah、Humanoid 两个高维环境基准上,先在参数空间子集中寻找次优解、再转向完整空间搜索,有助于启动学习,并以更少的 episodes 获得更好的性能。摘要未提供具体回报、训练预算、随机种子、对照设置或统计结果;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其潜在对应对象是具有连续控制输出和在线反馈的 BCI 策略学习,而非一般 EEG 分类。假设逐步开放控制自由度能降低早期探索难度,可考虑复用维度开放调度与遗忘约束,但需将模拟环境中的感知运动维度映射到实际解码输出及反馈信号。低信噪比、跨被试差异、小数据和非平稳反馈可能使 Intrinsic Motivation 难以区分有效探索与噪声,也可能使早期受限策略阻碍后续学习。一个可检验的小实验是在固定 EEG 解码输入、奖励和交互预算的离线模拟控制任务中,对比逐步开放与一次性开放控制维度,并分别移除遗忘约束,评估任务回报、收敛速度和旧能力保持情况。该实验仅检验迁移假设,不代表已证实的 BCI 效果;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对其以逐步开放感知运动维度来引导策略学习的机制,尤其是维度开放规则与遗忘约束各自的贡献;摘要中的性能改善尚需结合完整实验协议验证。

1月1日周一
  1. OpenReview · Representation learning72

    面向控制的状态表征学习:综述

    基于摘要分析。本文综述面向机器人与控制任务的 State Representation Learning(SRL,状态表征学习),关注如何从数据中学习低维、随时间演化且受智能体动作影响的状态表征,并梳理相关方法、实现、应用及评估思路,而非提出一个新的 BCI 算法。 核心机制是使表征捕获智能体动作引起的环境变化。作者指出,低维状态有助于缓解维度灾难,便于人类理解与使用,并可能提高强化学习等策略学习算法的性能与速度;摘要未提供这些效益的量化结果。综述覆盖涉及环境交互的 SRL 方法及其在模拟或真实机器人控制任务中的应用,重点比较通用学习目标如何被不同算法利用,并讨论表征评估方法及未来研究方向。 摘要未列出具体算法、损失函数、数据集、对照基线或评估指标,因此无法据此判断各类学习目标的优势及适用条件。方法覆盖范围、实验协议、消融及统计信息尚未验证;复现具体方法仍需查阅全文与对应原始研究。 平台推测(待验证):其潜在对应场景是具有时间序列、动作记录和环境反馈的闭环 EEG/BCI 控制,而非一般离线 EEG 分类。假设动作相关的低维状态可以帮助控制器组织连续交互信息,可借鉴表征学习目标与评估框架,但需改造 EEG 编码和信号—动作—反馈的时序对齐方式,并区分用户神经状态与外部环境状态。低信噪比、跨被试差异、通道变化及小数据规模可能使表征偏向伪迹或外部反馈,而非有用的神经信息。一个可证伪的小实验是在同一闭环任务、固定数据划分和相同控制器下,对比常规 EEG 特征与加入动作及反馈信息学习的低维表征,并通过打乱动作—反馈对应关系检验收益是否依赖真实交互结构。已有 EEG 相关工作尚未检索确认。

    阅读价值:该综述值得用于梳理交互式控制中的状态表征学习目标与评估思路,但其对 EEG/BCI 的适用性尚未验证。

  2. OpenReview · Representation learning72

    面向控制的状态表征学习:概述

    基于摘要分析。本文综述面向机器人与控制任务的状态表征学习(State Representation Learning,SRL),重点讨论如何从与环境的交互中学习低维、随时间变化且受智能体动作影响的状态特征,以及如何评价这些表征。 与一般表征学习相比,本文关注的 SRL 强调动作与环境变化的联系:表征应捕捉智能体动作所引起的环境变化,并服务于后续控制或策略学习。作者指出,低维表征有助于缓解维度灾难、便于人类理解和使用,并可能提升强化学习等策略学习算法的性能与速度;这些是摘要陈述的方法动机,不能视为本文已量化验证的效果。 综述范围包括需要环境交互的 SRL 方法、实现及其在仿真或真实机器人控制任务中的应用。其分析重点是不同算法如何利用通用学习目标,并讨论表征评估方法及当前与未来研究方向。摘要未列出具体算法、目标函数、数据集、对照基线或定量结果,相关评估协议及统计信息尚未验证。 平台推测(待验证):若 BCI 场景具有同步记录的神经信号、控制动作与环境反馈序列,动作相关的低维动态表征可能为闭环状态建模提供参考。可借鉴的是表征与控制目标之间的联系及评估框架,而非直接将机器人状态等同于 EEG 中的意图;观测编码、时间对齐和动作—反馈关系均需改造。低信噪比、反馈延迟、跨被试差异及有限交互数据可能使表征偏向外部反馈而非用户意图。一个可检验的小实验是在相同被试内划分和同一控制任务下,比较动作相关表征与仅重构神经信号的表征对下游控制的帮助,并核对收益是否依赖反馈信息。以上仅为机制层面的迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:该综述值得用于梳理交互式控制中的状态表征学习目标与评估思路,但摘要不足以确认具体方法对 EEG 或 BCI 的适用性。

  3. OpenReview · State space models74

    采用 Variational State Tabulation 的高效基于模型的深度强化学习

    基于摘要分析。本文研究深度强化学习的样本效率问题,提出 Variational State Tabulation(VaST),将高维环境状态空间映射为抽象的表格式模型,再通过规划更新状态—动作价值。主要研究对象是强化学习智能体及其环境,摘要举例包括视觉输入与 3D navigation,并非 EEG 解码或 BCI 实验。 核心机制是把高维状态表示与高效表格规划结合:VaST 构建抽象环境模型,随后使用带 small backups 的 prioritized sweeping 更新状态—动作价值。该路径有望利用已获得的环境经验进行规划,而不是仅依靠新增交互。摘要未说明变分目标、抽象状态的构造与容量、模型学习流程及探索策略,这些实现细节尚未验证。 作者报告,VaST 能在 3D navigation 等任务中快速学习奖励最大化,并能高效适应奖励或转移概率的突然变化。摘要未提供具体任务配置、交互样本量、对照基线或数值指标,因此无法量化效率提升,也无法判断不同变化条件下的适应幅度;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 BCI 闭环控制可表示为具有动作、奖励及近似稳定转移结构的序列决策问题,VaST 的抽象状态建模与规划机制可能用于研究交互样本有限时的策略学习,而非直接替代 EEG 分类器。可复用部分是抽象状态后的表格规划;需改造部分是 EEG 观测编码与状态抽象,并核对其能否保留决策所需信息。低信噪比、跨被试差异和通道变化可能导致不同潜在状态被错误合并,小数据也可能使转移估计不可靠。 一个可检验的小实验是假设固定 EEG 编码器与闭环任务,在相同交互预算及独立评估条件下,比较加入 VaST 式抽象模型规划与不使用该规划的策略,观察累计奖励及奖励规则突变后的恢复过程;这仅是迁移假设,不是本文已验证结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将高维观测抽象为表格式环境模型、再以 prioritized sweeping 进行规划的机制,以核对样本效率与环境变化适应能力的来源;其对 EEG/BCI 的适用性尚未验证。

1月1日周一
  1. OpenReview · Representation learning72

    强化学习中的表征迁移

    基于摘要分析。本文研究强化学习智能体采用不同内部表征时,如何迁移已学习的知识以减少目标端学习时间;核心贡献是定义 representation transfer,将其与 task transfer 区分,并提出两种新算法。 常见 task transfer 利用源任务知识促进相关但不同的目标任务学习;本文则聚焦不同内部表征之间的知识迁移。两类问题的共同目标,是相对于不使用迁移的学习过程缩短目标端学习时间。摘要未说明内部表征的具体形式、两种算法的映射机制、知识载体或训练流程,不能据此将其解释为特定的神经网络表征对齐方法。 作者报告,两种算法已在一个复杂多智能体领域中实现,实验显示不同表征之间的知识迁移具有可行性和收益;作者还报告,representation transfer 算法也可用于 task transfer,从而建立二者的实证联系。摘要未提供领域名称、学习时间指标、收益数值、对照细节或数据划分,实验协议、消融及统计信息尚未验证,尚不能判断收益幅度与适用边界。 平台推测(待验证):其研究问题可启发采用不同 EEG 特征表示的强化学习式 BCI 自适应,但这一假设依赖可对应的状态、动作及奖励结构,不能直接等同于跨被试或跨通道迁移。可复用的是跨表征迁移的研究框架;具体映射模块仍需全文确认,并针对 EEG 的低信噪比、被试差异与小数据条件改造。一个可检验的小实验是在固定任务、动作和奖励定义下,比较两种 EEG 特征表示之间的知识迁移与目标表示从零学习,按相同交互预算评估学习曲线及负迁移风险。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 representation transfer 与 task transfer 的区分及二者的实证联系,但算法机制、学习时间收益与迁移适用条件仍需全文核对。

12月31日周三
  1. OpenReview · State space models73

    多智能体环境中用于移动机器人学习的基于视觉的状态空间构建

    基于摘要分析。本文研究多智能体环境中移动机器人如何从视觉观测构建适合强化学习的状态空间,提出通过观察与动作交互进行系统辨识,估计学习机器人行为与其他智能体行为之间的关系,再利用 Akaike’s Information Criterion(AIC,赤池信息准则)确定各智能体的状态向量。 核心问题是:其他智能体的策略未知,其动作会改变机器人看到的视觉信息,使观测变化难以直接归因于机器人自身运动。方法先辨识交互关系并构造状态表示,再基于估计的状态向量进行强化学习以获取最优行为。这里的“state space”指机器人强化学习中的状态空间构建,摘要并未描述现代序列建模中的 State Space Model 架构。 作者报告将方法应用于机器人足球场景中的实体智能体,使其学习应对滚动的球和另一移动智能体,并展示计算机仿真及真实实验。摘要未提供定量结果、对照方法或状态估计误差,因此不能据此判断性能提升幅度。系统辨识的具体形式、AIC 候选模型、视觉特征、强化学习算法,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):若用于具有动作反馈和环境观测的闭环 BCI,该机制可能帮助区分用户控制引起的环境变化与外部对象运动,但它并非直接针对 EEG 解码。可复用的是交互辨识与状态选择思路;视觉观测模型需改造为神经信号、控制输出及环境反馈的联合表示。此假设依赖可对齐的时序交互数据,EEG 低信噪比、反馈延迟、跨被试差异和小数据可能使辨识不稳定。一个可检验的小实验是在固定 EEG 解码器与控制策略下,比较加入辨识状态和仅用当前观测的闭环任务表现,并分别设置静态与移动干扰对象;已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是其通过交互式系统辨识与 Akaike’s Information Criterion 构造多智能体强化学习状态空间的机制,但摘要不足以验证状态估计质量、学习效果及其对 EEG/BCI 的适用性。

1月1日周三
  1. OpenReview · State space models82

    一般状态空间平均奖励 Markov 决策过程的策略迭代算法

    基于摘要分析。本文研究一般状态空间、无界成本的 Markov 决策过程中的平均成本最优控制,核心贡献是建立策略迭代所生成策略的正则性、相对价值函数序列的收敛性质,以及在进一步条件下获得最优平均成本策略的理论保证。原标题采用 average reward,摘要则以 average cost 表述问题,具体符号约定尚未验证。 核心机制与条件:作者报告,只要存在一个初始 c-regular 策略,并满足状态空间上的不可约性条件,策略迭代便生成一系列 c-regular 策略,其中 c 为所考虑的成本函数。在这些条件下,算法生成的相对价值函数序列具有下界且“近乎”递减,作者据此得到算法收敛结论。c-regular 的严格定义、“近乎”递减的数学含义与收敛方式需查阅全文,不能仅凭摘要将其等同于逐点单调下降。 最优性与应用:算法收敛不应直接等同于得到最优策略。作者报告,在进一步条件下,算法能够求得最优性方程的解,从而得到最优平均成本策略;摘要未列明这些附加条件。作者还报告,这些结果提供了无界成本问题中最优策略存在性的判据,并恢复标准 linear-quadratic-Gaussian 问题的已知结果。在多类别排队网络控制中,作者指出网络优化与更简单的流体网络模型最优控制存在密切联系,具体对应关系尚未验证。 证据范围:这是最优控制理论研究,不是神经信号建模或 BCI 验证。摘要未提供 EEG/BCI 任务或足以支持具体迁移方案的机制对应,因此不据此提出 BCI 复现实验;已有 EEG 相关工作尚未检索确认。阅读全文时应重点核对正则性与不可约性假设、策略评价和改进步骤、最优性所需的附加条件及流体模型对应关系。实验协议、消融及统计信息尚未验证。

    阅读价值:值得阅读的具体原因是其给出一般状态空间、无界成本条件下策略迭代的收敛与最优性条件,并区分算法收敛和获得最优策略所需的假设;这些理论尚不能直接作为 BCI 控制有效性的证据。