跳到正文

算法、任务与模态

Reinforcement Learning 最新动态

Reinforcement Learning 研究索引;按可核对的标签归档,不以热度评价质量。

128 条精选近 30 天 35 条共收录 159 条

更新

精选归档 · 第 7 页

1月1日周六第 121–128 条
  1. OpenReview · State space models70

    在猴目标搜索任务中测试的动态状态空间强化学习模型:扩展至任务事件学习

    基于摘要分析。本研究面向灵长类生理实验使用的双目标搜索任务,研究强化学习模型如何利用试次历史,并将初始中央注视等任务事件纳入学习。作者在既有动态状态空间框架上提出“history-in-episode architecture”,将状态表示区分为 episode 与历史,使动作选择依赖各 episode 内的历史。 任务中,智能体需注视四个光点之一,两个相邻光点交替作为正确目标;达到一定次数的连续成功后,正确目标对切换。获得高概率奖励需要依据前两个试次的动作与结果作出决策。因此,研究的关键不是单次刺激到动作的映射,而是如何表示具有历史依赖和任务阶段结构的决策状态。摘要指出,既有动态状态空间能够处理前述历史依赖,而新架构旨在进一步支持包含初始中央注视等事件的任务。 作者报告,在该双目标搜索任务中,包含新架构与动态状态空间的模型表现接近理论最优;作为对照的 conventional SARSA 未能实现目标对切换,作者将其解释为该方法每次都需要重新学习正确目标。摘要未给出具体分数、理论最优的计算方式、训练规模或对照状态编码,不能据此推广为对所有 SARSA 实现的优势。动态状态空间的构建与更新规则、奖励设置、实验协议、消融及统计信息尚未验证。 该研究的主要对象是猴目标搜索任务的强化学习建模,不是 EEG 解码或 BCI 临床验证;摘要未提供猴行为与模型拟合的定量结果,也未说明使用神经信号训练或评估。其明确贡献在于任务事件与历史依赖的状态组织机制,原任务中的表现不构成 BCI 有效性的证据。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体原因是其将任务 episode 与 episode 内历史分开表示,并在需要跨试次记忆的目标搜索任务中与 conventional SARSA 对照;性能结论及动态状态空间的实现细节尚需全文核对。

1月1日周五
  1. OpenReview · State space models72

    在猴目标搜索任务上测试的动态状态空间强化学习模型:基于经验饱和与决策唯一性自主确定历史状态

    基于摘要分析。该研究针对强化学习通常预先给定状态空间、难以适应事先无法完整界定的环境这一问题,提出根据经验饱和(experience saturation)与动作选择的决策唯一性(decision uniqueness)动态扩展状态空间的方法。主要研究对象是强化学习智能体在此前用于猴的目标搜索任务中的行为适应,而非 EEG 解码或 BCI 控制。 任务包含四个相邻位置,其中两个位置交替成为正确目标;在利用阶段连续正确若干次后,有效位置对发生切换,智能体需在探索阶段寻找新的位置对。摘要指出,仅依据前一试次不足以获得最大回报,需要结合前两个试次选择动作。模型不预先获知这一任务结构,而是依据上述两项判据扩展历史状态表示,使决策能够参考多个试次。判据的数学定义、状态扩展流程及学习更新规则尚未验证。 作者报告,在该目标搜索任务中,模型表现可比于预先获知任务结构的理想模型;在模型开发时未预设的另一项任务上也表现良好。作者还报告模型学会了合理搜索,并称其未陷入探索与利用的权衡困境。摘要未提供具体指标、数值、另一任务的细节或统计依据,因此这些结论的适用范围需结合全文核对。实验协议、消融及统计信息尚未验证;该摘要也不足以确认模型与猴行为数据的拟合程度。 平台推测(待验证):可检验的迁移假设是,这种按历史经验扩展状态表示的机制,可能适用于具有延迟反馈或历史依赖的 BCI 交互控制,而不直接解决 EEG 信号特征提取。可复用部分是状态扩展判据;需改造的是神经信号到状态的映射及反馈定义。低信噪比、跨被试与跨通道差异可能被误判为历史依赖,小数据则可能使经验饱和难以可靠判断。小规模验证可在固定 EEG 解码输出的历史依赖控制仿真中,对比固定单步、固定双步与动态历史状态策略,在一致反馈预算和噪声条件下检验回报与状态规模。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的具体机制是以经验饱和与动作选择的决策唯一性为判据,自适应扩展历史状态表示;作者报告了任务适应能力,但其对 EEG/BCI 的价值尚未验证。

1月1日周三
  1. OpenReview · State space models80

    无界状态空间下的稳定强化学习

    基于摘要分析。本文研究由排队网络调度问题引出的无界状态空间强化学习(RL),主要贡献是将稳定性作为策略质量的评价概念:策略作用下的状态动态应以高概率保持在有界区域内,而非直接沿用有限或紧致状态空间中的误差指标。 作者指出,传统策略及 ℓ∞ 等误差度量在无界状态空间中可能需要无限样本才能提供有意义的性能保证。作为概念验证,作者提出使用 Sparse-Sampling-based Monte Carlo Oracle 的 RL 策略,并论证:若最优策略下的系统动态满足 Lyapunov 函数条件,该策略可满足稳定性要求。作者强调,策略无需知道具体的 Lyapunov 函数,并将该函数的存在与 Markov 链的正常返或稳定性联系起来;这些条件的精确定义和适用范围需核对全文。 为提高样本效率,作者进一步提出利用 Lipschitz 价值函数的改进型 Sparse-Sampling-based Monte Carlo Oracle,并通过统计检验构造自适应算法,自动寻找合适的调节参数。摘要未提供数值实验结果、采样复杂度表达式或具体对照;理论假设、实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可能适用于具有明确状态转移模型和稳定性目标的 BCI 闭环控制,而不是直接解决 EEG 解码。可复用部分是采样规划与自适应参数选择,需改造的是神经状态定义、模拟采样接口及稳定性判据。假设低信噪比 EEG 能提供足够可靠的状态估计,可先在含观测噪声的低维闭环仿真中,对照固定参数版本,检验状态越界频率与采样开销;跨被试差异及小数据可能使状态模型和 Lipschitz 假设失效。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读的是其以稳定性替代无界状态空间中的一致误差保证,并将 Lyapunov 条件与采样式 RL 策略联系起来;具体理论边界及对 BCI 闭环控制的适用性尚未验证。

  2. OpenReview · State space models78

    无界状态空间中的稳定强化学习

    基于摘要分析。该研究以排队网络调度为动机,研究无界状态空间中的强化学习(RL),提出使用 Sparse-Sampling-based Monte Carlo Oracle 的在线 RL 策略,并以系统状态是否能以高概率保持在有界区域内作为稳定性标准,而非仅以奖励衡量策略表现。 核心机制与理论贡献:作者认为,仅依赖有限样本训练的策略难以在整个无界状态空间中保持良好表现,因此需要在线训练。作者报告的理论结论是:若最优策略下的系统动力学满足 Lyapunov 函数条件,所提策略便具有稳定性,且策略本身无需知道该 Lyapunov 函数。作者进一步指出,Lyapunov 函数的存在与马尔可夫链的正常返性或稳定性具有对应关系,并据此说明该假设的适用性。具体条件、定理量词及证明细节尚未验证,不能将其概括为任意环境下的无条件稳定保证。 证据与复现边界:摘要未提供 Oracle 的具体实现、在线采样与更新规则、计算开销或实验结果。实验协议、消融及统计信息尚未验证;复现前需要核对状态与动作结构、环境交互或模拟访问要求,以及稳定性结论所依赖的动力学条件。本研究对象是无界状态空间中的控制问题,不是 EEG 状态空间建模或神经信号解码。 平台推测(待验证):其潜在关联限于具有明确动态状态和控制反馈的 BCI 闭环系统,可借鉴以稳定性而非单次奖励评估控制策略的思路。假设闭环过程能被合理建模为受控马尔可夫系统,并具备相应稳定性条件,才可能复用其分析框架;需改造的是状态估计、反馈动作与环境交互机制。EEG 的低信噪比、部分可观测性和跨被试变化可能破坏这些前提,小数据也可能限制在线采样。可先在具有已知稳定控制策略的简化闭环模拟器中加入观测噪声,对比所提策略与有限样本训练策略的状态越界频率及任务回报,检验该迁移假设。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其以 Lyapunov 条件分析在线 RL 策略稳定性的理论路径,但该保证针对无界状态空间系统,不等同于 EEG 解码性能或 BCI 闭环安全性保证。

1月1日周一
  1. OpenReview · Representation learning72

    面向控制的状态表征学习:综述

    基于摘要分析。本文综述面向机器人与控制任务的 State Representation Learning(SRL,状态表征学习),关注如何从数据中学习低维、随时间演化且受智能体动作影响的状态表征,并梳理相关方法、实现、应用及评估思路,而非提出一个新的 BCI 算法。 核心机制是使表征捕获智能体动作引起的环境变化。作者指出,低维状态有助于缓解维度灾难,便于人类理解与使用,并可能提高强化学习等策略学习算法的性能与速度;摘要未提供这些效益的量化结果。综述覆盖涉及环境交互的 SRL 方法及其在模拟或真实机器人控制任务中的应用,重点比较通用学习目标如何被不同算法利用,并讨论表征评估方法及未来研究方向。 摘要未列出具体算法、损失函数、数据集、对照基线或评估指标,因此无法据此判断各类学习目标的优势及适用条件。方法覆盖范围、实验协议、消融及统计信息尚未验证;复现具体方法仍需查阅全文与对应原始研究。 平台推测(待验证):其潜在对应场景是具有时间序列、动作记录和环境反馈的闭环 EEG/BCI 控制,而非一般离线 EEG 分类。假设动作相关的低维状态可以帮助控制器组织连续交互信息,可借鉴表征学习目标与评估框架,但需改造 EEG 编码和信号—动作—反馈的时序对齐方式,并区分用户神经状态与外部环境状态。低信噪比、跨被试差异、通道变化及小数据规模可能使表征偏向伪迹或外部反馈,而非有用的神经信息。一个可证伪的小实验是在同一闭环任务、固定数据划分和相同控制器下,对比常规 EEG 特征与加入动作及反馈信息学习的低维表征,并通过打乱动作—反馈对应关系检验收益是否依赖真实交互结构。已有 EEG 相关工作尚未检索确认。

    阅读价值:该综述值得用于梳理交互式控制中的状态表征学习目标与评估思路,但其对 EEG/BCI 的适用性尚未验证。

  2. OpenReview · Representation learning72

    面向控制的状态表征学习:概述

    基于摘要分析。本文综述面向机器人与控制任务的状态表征学习(State Representation Learning,SRL),重点讨论如何从与环境的交互中学习低维、随时间变化且受智能体动作影响的状态特征,以及如何评价这些表征。 与一般表征学习相比,本文关注的 SRL 强调动作与环境变化的联系:表征应捕捉智能体动作所引起的环境变化,并服务于后续控制或策略学习。作者指出,低维表征有助于缓解维度灾难、便于人类理解和使用,并可能提升强化学习等策略学习算法的性能与速度;这些是摘要陈述的方法动机,不能视为本文已量化验证的效果。 综述范围包括需要环境交互的 SRL 方法、实现及其在仿真或真实机器人控制任务中的应用。其分析重点是不同算法如何利用通用学习目标,并讨论表征评估方法及当前与未来研究方向。摘要未列出具体算法、目标函数、数据集、对照基线或定量结果,相关评估协议及统计信息尚未验证。 平台推测(待验证):若 BCI 场景具有同步记录的神经信号、控制动作与环境反馈序列,动作相关的低维动态表征可能为闭环状态建模提供参考。可借鉴的是表征与控制目标之间的联系及评估框架,而非直接将机器人状态等同于 EEG 中的意图;观测编码、时间对齐和动作—反馈关系均需改造。低信噪比、反馈延迟、跨被试差异及有限交互数据可能使表征偏向外部反馈而非用户意图。一个可检验的小实验是在相同被试内划分和同一控制任务下,比较动作相关表征与仅重构神经信号的表征对下游控制的帮助,并核对收益是否依赖反馈信息。以上仅为机制层面的迁移假设,已有 EEG 相关工作尚未检索确认。

    阅读价值:该综述值得用于梳理交互式控制中的状态表征学习目标与评估思路,但摘要不足以确认具体方法对 EEG 或 BCI 的适用性。

  3. OpenReview · State space models74

    采用 Variational State Tabulation 的高效基于模型的深度强化学习

    基于摘要分析。本文研究深度强化学习的样本效率问题,提出 Variational State Tabulation(VaST),将高维环境状态空间映射为抽象的表格式模型,再通过规划更新状态—动作价值。主要研究对象是强化学习智能体及其环境,摘要举例包括视觉输入与 3D navigation,并非 EEG 解码或 BCI 实验。 核心机制是把高维状态表示与高效表格规划结合:VaST 构建抽象环境模型,随后使用带 small backups 的 prioritized sweeping 更新状态—动作价值。该路径有望利用已获得的环境经验进行规划,而不是仅依靠新增交互。摘要未说明变分目标、抽象状态的构造与容量、模型学习流程及探索策略,这些实现细节尚未验证。 作者报告,VaST 能在 3D navigation 等任务中快速学习奖励最大化,并能高效适应奖励或转移概率的突然变化。摘要未提供具体任务配置、交互样本量、对照基线或数值指标,因此无法量化效率提升,也无法判断不同变化条件下的适应幅度;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 BCI 闭环控制可表示为具有动作、奖励及近似稳定转移结构的序列决策问题,VaST 的抽象状态建模与规划机制可能用于研究交互样本有限时的策略学习,而非直接替代 EEG 分类器。可复用部分是抽象状态后的表格规划;需改造部分是 EEG 观测编码与状态抽象,并核对其能否保留决策所需信息。低信噪比、跨被试差异和通道变化可能导致不同潜在状态被错误合并,小数据也可能使转移估计不可靠。 一个可检验的小实验是假设固定 EEG 编码器与闭环任务,在相同交互预算及独立评估条件下,比较加入 VaST 式抽象模型规划与不使用该规划的策略,观察累计奖励及奖励规则突变后的恢复过程;这仅是迁移假设,不是本文已验证结果。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其将高维观测抽象为表格式环境模型、再以 prioritized sweeping 进行规划的机制,以核对样本效率与环境变化适应能力的来源;其对 EEG/BCI 的适用性尚未验证。

1月1日周一
  1. OpenReview · Representation learning72

    强化学习中的表征迁移

    基于摘要分析。本文研究强化学习智能体采用不同内部表征时,如何迁移已学习的知识以减少目标端学习时间;核心贡献是定义 representation transfer,将其与 task transfer 区分,并提出两种新算法。 常见 task transfer 利用源任务知识促进相关但不同的目标任务学习;本文则聚焦不同内部表征之间的知识迁移。两类问题的共同目标,是相对于不使用迁移的学习过程缩短目标端学习时间。摘要未说明内部表征的具体形式、两种算法的映射机制、知识载体或训练流程,不能据此将其解释为特定的神经网络表征对齐方法。 作者报告,两种算法已在一个复杂多智能体领域中实现,实验显示不同表征之间的知识迁移具有可行性和收益;作者还报告,representation transfer 算法也可用于 task transfer,从而建立二者的实证联系。摘要未提供领域名称、学习时间指标、收益数值、对照细节或数据划分,实验协议、消融及统计信息尚未验证,尚不能判断收益幅度与适用边界。 平台推测(待验证):其研究问题可启发采用不同 EEG 特征表示的强化学习式 BCI 自适应,但这一假设依赖可对应的状态、动作及奖励结构,不能直接等同于跨被试或跨通道迁移。可复用的是跨表征迁移的研究框架;具体映射模块仍需全文确认,并针对 EEG 的低信噪比、被试差异与小数据条件改造。一个可检验的小实验是在固定任务、动作和奖励定义下,比较两种 EEG 特征表示之间的知识迁移与目标表示从零学习,按相同交互预算评估学习曲线及负迁移风险。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得阅读其对 representation transfer 与 task transfer 的区分及二者的实证联系,但算法机制、学习时间收益与迁移适用条件仍需全文核对。