跳到正文
OpenReview · State space models· Andris Ambainis; Joao F. Doriguello; Debbie Lim·· 2024-09-27精选AI 评分78

连续状态空间 MDP 在线学习的量子算法

Quantum Algorithm for Online Learning of MDPs with Continuous State Space

AI 导读

基于摘要分析。本文研究平均奖励模型下连续状态空间 Markov Decision Processes(MDPs)的在线学习,提出基于经典 UCCRL 路线的量子算法。主要贡献包括在线学习遗憾界、作为子程序的 quantum extended value iteration,以及该子程序生成的价值函数序列的极限行为分析;研究对象是容错量子计算条件下的决策学习,而非 EEG 解码或经典 state space models。 作者报告,在量子可访问环境条件下,一维状态空间的算法遗憾为 Õ(T^{1/2}),相较所引用经典工作的 Õ(T^{2/3}) 界有所改善,其中 T 为算法迭代次数;对于一般 d 维状态空间,作者报告遗憾界为 Õ(T^{1−1/(2d)})。这些是理论界,不是数据集上的实测性能,具体环境正则性、访问模型及界中隐藏项尚未验证。作者称,据其所知,这是首次在容错量子设置下研究连续状态空间 MDPs。 算法使用 quantum extended value iteration。作者报告,相对经典对应算法,该子程序在离散化状态空间 S 的规模上获得次二次加速,在动作空间 A 的规模上获得二次加速;具体复杂度表达式与误差依赖需查阅全文。作者还报告,其生成的价值函数序列收敛至最优平均奖励 ρ* 的 ε 加性误差范围内,其中 ε>0 为小量;收敛对象和条件的精确定义尚未验证。 平台推测(待验证):若将连续状态 MDP 用于 BCI 自适应控制,本文可能提供决策规划层面的理论参考,但量子可访问环境与容错量子计算是关键前提,不能假定普通 EEG 数据流满足这些条件。摘要不足以建立具体的 EEG 迁移路径,因此不提出复现实验方案。已有 EEG 相关工作尚未检索确认;实验协议、消融及统计信息,以及实现和资源需求,均尚未验证。

阅读价值

值得阅读的具体价值在于量子可访问环境假设下的连续状态 MDP 遗憾界及 quantum extended value iteration 的复杂度分析,但这些理论收益不能直接视为现实 EEG/BCI 在线学习的加速效果。

来源:OpenReview · State space models · openreview.net