跳到正文
OpenReview · State space models· Siliang Zeng; Mingyi Hong; Alfredo Garcia·· 2025-03-01精选AI 评分79

具有有限时间保证的高维状态空间马尔可夫决策过程结构估计

Structural Estimation of Markov Decision Processes in High-Dimensional State Space with Finite-Time Guarantees

AI 导读

该研究根据人类智能体已执行的动作与访问状态的可观测历史,估计其动态决策的结构模型,提出单循环算法以缓解高维状态空间下嵌套优化的计算负担。基于摘要分析,未取得论文全文。 原问题包含两层优化:内层寻找给定奖励函数下的最优策略,外层最大化模型对观测历史的拟合度。摘要指出,既有减轻嵌套计算的方法在大型离散或高维连续状态空间中仍面临复杂度问题,而部分逆强化学习方法侧重策略估计,可能牺牲奖励估计准确性。本文的核心机制是在每次策略改进后,执行一次用于似然最大化的随机梯度更新,将两层优化整合为单循环过程。 作者报告,该算法具有收敛至驻点的有限时间保证;当奖励采用线性参数化时,算法以次线性速率逼近最大似然估计量。这里的驻点保证不应等同于一般情形下的全局最优保证。摘要未给出具体收敛速率、状态表示、策略改进实现或实证对照,理论假设、实验协议、消融及统计信息尚未验证。材料说明支持研究的代码与数据位于文章补充材料,但其内容与可运行性尚未核验。 平台推测(待验证):若 BCI 交互研究具备连续的状态—动作轨迹,且目标是估计使用者的潜在奖励偏好而非直接解码 EEG,该单循环机制可能用于降低行为模型拟合成本。可复用的是策略改进与奖励似然更新框架,需改造的是神经信号对应的状态表示及观测模型;低信噪比、跨被试差异和小样本可能使状态估计与奖励辨识不稳定。一个可检验的小实验是在固定状态表示和相同轨迹划分下,对比单循环与嵌套估计的计算成本、留出轨迹似然及模拟数据上的奖励恢复误差。该迁移假设不是论文已证实的结果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其交替执行策略改进与似然梯度更新的单循环机制,以及有限时间保证所需的条件;该方法针对人类动态决策的奖励估计,尚不能视为已验证的 EEG/BCI 方法。

来源:OpenReview · State space models · openreview.net