跳到正文
OpenReview · Representation learning· Changmin Yu; Máté Lengyel·· 2026-05-01精选AI 评分75

用于稳健迁移的层次化后继表征

Hierarchical Successor Representation for Robust Transfer

AI 导读

基于摘要分析。本文研究强化学习中的预测性状态表征与任务迁移,提出 Hierarchical Successor Representation(HSR),通过时间抽象缓解经典 successor representation(SR,后继表征)对策略变化的敏感性,并结合 non-negative matrix factorisation(NMF,非负矩阵分解)构建稀疏、低秩状态表征。主要研究对象是环境中的状态、策略、奖励与探索,而非 EEG 或 BCI。 经典 SR 将预测动态与奖励分离,有利于在奖励配置变化时复用表征;但其依赖当前策略,持续学习、环境非平稳性及任务需求变化可能使已有表征失效。摘要还指出,在拓扑复杂环境中,SR 的谱扩散会产生稠密、重叠的特征,限制可扩展性。HSR 的机制是将时间抽象纳入预测表征的构建,再以 NMF 提取稀疏低秩结构;具体时间抽象形式、优化目标及分解训练方式尚未验证。 作者报告,HSR 学到的状态特征对任务诱发的策略变化具有稳健性,HSR-NMF 在多分区环境中支持向新任务的高样本效率迁移,并发现可解释的拓扑结构。作者将其描述为不依赖策略的层次地图,用以连接 model-free 的最优性与 model-based 的灵活性;作者还报告,时间扩展的预测结构可用于高效探索,并扩展至大型程序生成环境。摘要未提供量化指标、任务划分、基线结果或统计信息,因此这些结论的适用范围与优势幅度尚未验证,实验协议、消融及统计信息亦尚未验证。 平台推测(待验证):若闭环 BCI 可表示为具有稳定转移结构、可观测状态及奖励反馈的序贯决策问题,HSR 可能为任务目标变化后的控制策略复用提供机制参考,而不能直接视为 EEG 解码方法。可复用的是时间抽象预测表征与 NMF 分解,需改造的是神经信号到状态的映射及转移估计。低信噪比、跨被试与通道变化可能破坏状态一致性,小数据则可能不足以估计长期转移结构。一个可检验的小实验是在固定状态编码的闭环 BCI 仿真中仅改变奖励目标,以相同交互预算比较 SR 与 HSR-NMF 的迁移学习曲线及表征稳定性;其前提是先核对全文实现。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对的是,HSR 如何通过时间抽象缓解 SR 的策略依赖,并结合 NMF 支持任务迁移与探索;摘要给出了明确机制路径,但其稳健性与样本效率尚需全文实验验证。

来源:OpenReview · Representation learning · openreview.net