跳到正文
OpenReview · State space models· Abolfazl Lavaei; Fabio Somenzi; Sadegh Soudjani; Ashutosh Trivedi; Majid Zamani·· 2020-04-21精选AI 评分78

通过无模型强化学习对连续空间 MDP 进行形式化控制器合成

Formal Controller Synthesis for Continuous-Space MDPs via Model-Free Reinforcement Learning

AI 导读

基于摘要分析。本文研究未知连续空间 Markov decision processes(MDPs)的形式化控制器合成,提出借助隐式有限状态抽象使用现成无模型强化学习算法的方法,目标是在给定有限时间范围内最大化系统满足指定逻辑性质的概率,并提供近似最优性及概率接近性保证。 核心机制是将连续空间系统抽象为转移概率未知的有限 MDP,但不显式构建该抽象模型;随后在抽象层合成策略,再将策略映射回原连续空间系统。控制规范采用 syntactically co-safe linear temporal logic(scLTL),即语法共安全线性时序逻辑。作者利用有限 MDP 强化学习的经典收敛结果,为连续空间中的控制策略建立保证。摘要未给出抽象误差界、概率接近性的具体定义,以及收敛所需的系统、采样和探索条件,这些均需核对正文。 针对基于自动机的奖励通常较稀疏的问题,作者提出基于势函数的奖励塑形,以生成稠密奖励并加快学习。势函数构造、策略最优性保持条件及与未塑形奖励的对照结果尚未验证。作者报告在三个物理控制基准上展示了方法有效性,分别涉及房间温度调节、道路交通单元控制和 BMW 320i 汽车的七维非线性模型;摘要未提供效果数值,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若闭环 BCI 的自适应控制问题能够表示为具有可观测状态、离散动作和有限时域逻辑目标的 MDP,可考虑复用逻辑规范到自动机奖励的转换及奖励塑形机制;连续状态抽象和策略映射则需按神经信号与反馈过程改造。EEG 低信噪比、状态部分可观测、跨被试差异及小数据探索不足,可能使原方法的建模假设或保证不再适用。一个可检验的小实验是在固定状态估计器和控制规范的闭环模拟环境中,对比稀疏奖励与势函数塑形奖励的目标满足概率及学习样本量,再加入观测噪声检验稳定性。该实验仅能检验迁移假设,不能替代真实 BCI 验证;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其如何将连续空间系统的形式化控制目标转为有限 MDP 上的无模型强化学习问题,并核对近似最优性保证与势函数奖励塑形的适用条件;其 BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net