跳到正文
OpenReview · State space models· Meiling Hao; Pingfan Su; Liyuan Hu; Zoltan Szabo; Qingyuan Zhao; Chengchun Shi·· 2024-12-31精选AI 评分79

用于离策略评估的前向与后向状态抽象

Forward and Backward State Abstractions for Off-policy Evaluation

AI 导读

基于摘要分析。本文研究大状态空间中的离策略评估(Off-policy evaluation,OPE):如何在部署前利用离线数据评估目标策略,同时通过状态抽象降低评估难度。研究对象是马尔可夫决策过程(MDP)中的策略评估,而非 EEG 信号解码;核心贡献是为 OPE 建立状态抽象条件、提出迭代抽象程序,并分析抽象空间中估计量的一致性。 机制上,作者将原本用于策略学习的状态抽象引入 OPE,定义一组与评估有关的无关性条件,并通过构造时间反向 MDP,推导 backward-model-irrelevance 条件,以处理序贯及边缘化重要性采样比率中的无关性。作者进一步提出逐步将原状态空间投影到较小空间的迭代程序,得到深度抽象状态。作者报告,该程序能够简化由状态空间高基数带来的 OPE 样本复杂度,并证明多种 OPE 估计量在所提抽象状态空间上的 Fisher 一致性。摘要未提供具体估计量、抽象学习目标、复杂度界及定理假设;Fisher 一致性也不等同于有限样本精度保证。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若某类 BCI 交互任务具有可记录的状态、动作、奖励与行为策略信息,这类抽象可能用于压缩策略评估状态,而不是直接替代 EEG 特征提取。可考虑复用抽象迭代与 OPE 估计框架,但需核对神经信号状态是否满足 MDP 假设、抽象是否保留评估所需信息,以及行为策略对目标策略的覆盖条件。低信噪比、跨被试差异、通道变化与小数据可能使抽象丢失关键状态信息或使重要性权重不稳定。一个可检验的小实验是在具有已知策略价值的受控序贯模拟中加入 EEG 式噪声与被试偏移,比较原状态与抽象状态下同一 OPE 估计量的误差和方差,再决定是否进入真实 BCI 数据验证。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其时间反向 MDP 所导出的状态抽象条件,以及抽象后 OPE 估计量的 Fisher 一致性证明,但这些理论性质尚不能直接视为 EEG/BCI 场景中的有效性证据。

来源:OpenReview · State space models · openreview.net