通过扩展感知运动空间实现发展式强化学习
Developmental Reinforcement Learning through Sensorimotor Space Enlargement
基于摘要分析。该研究面向连续感知运动空间中的无模型深度强化学习,提出受儿童发展启发的迁移学习方式:让智能体在学习策略的过程中逐步扩大可用的感知运动空间,而非一开始就在完整空间中搜索。 核心机制是在基于神经网络的 actor-critic 中加入 developmental layers,依据 Intrinsic Motivation 启发式逐步开放部分感知运动维度。为缓解空间扩展过程中的灾难性遗忘,作者借鉴 Elastic Weight Constraint 调节神经控制器的学习。摘要未给出维度开放规则、约束的数学形式及训练调度,不能据此确定具体网络结构或损失函数。 作者报告,在 DDPG 和 NFAC 两种算法以及 Half-Cheetah、Humanoid 两个高维环境基准上,先在参数空间子集中寻找次优解、再转向完整空间搜索,有助于启动学习,并以更少的 episodes 获得更好的性能。摘要未提供具体回报、训练预算、随机种子、对照设置或统计结果;实验协议、消融及统计信息尚未验证。 平台推测(待验证):其潜在对应对象是具有连续控制输出和在线反馈的 BCI 策略学习,而非一般 EEG 分类。假设逐步开放控制自由度能降低早期探索难度,可考虑复用维度开放调度与遗忘约束,但需将模拟环境中的感知运动维度映射到实际解码输出及反馈信号。低信噪比、跨被试差异、小数据和非平稳反馈可能使 Intrinsic Motivation 难以区分有效探索与噪声,也可能使早期受限策略阻碍后续学习。一个可检验的小实验是在固定 EEG 解码输入、奖励和交互预算的离线模拟控制任务中,对比逐步开放与一次性开放控制维度,并分别移除遗忘约束,评估任务回报、收敛速度和旧能力保持情况。该实验仅检验迁移假设,不代表已证实的 BCI 效果;已有 EEG 相关工作尚未检索确认。
值得核对其以逐步开放感知运动维度来引导策略学习的机制,尤其是维度开放规则与遗忘约束各自的贡献;摘要中的性能改善尚需结合完整实验协议验证。
来源:OpenReview · State space models · openreview.net