跳到正文
OpenReview · State space models· Abolfazl Lavaei; Fabio Somenzi; Sadegh Soudjani; Ashutosh Trivedi; Majid Zamani·· 2020-01-01精选AI 评分78

通过无模型强化学习实现连续空间 MDP 的形式化控制器合成

Formal Controller Synthesis for Continuous-Space MDPs via Model-Free Reinforcement Learning

AI 导读

基于摘要分析。该论文研究未知连续空间 Markov decision processes(MDPs)的形式化控制器合成:在给定有界时间范围内,寻找使 syntactically co-safe linear temporal logic(scLTL)规范满足概率最大化的控制策略。核心贡献是无需显式构建有限状态抽象,即可借用面向有限 MDP 的现成无模型强化学习算法,并将策略映射回原连续空间系统。 方法以转移概率未知的有限 MDP 抽象为基础,在抽象层学习策略,再回到具体系统。作者报告,该框架利用有限 MDP 强化学习的经典收敛结果,为连续空间系统提供近似最优性及概率接近性保证。摘要未给出抽象误差界、系统正则性假设、采样条件或具体学习算法,保证如何依赖这些条件尚未验证。 针对基于自动机的奖励通常较稀疏的问题,作者提出一种基于势函数的奖励塑形方法,以产生稠密奖励并加快学习。势函数构造、奖励与规范满足概率之间的对应关系,以及塑形后策略最优性的保持条件,需要全文核对。作者报告在房间温度调节、道路交通单元控制及 BMW 320i 汽车的七维非线性模型三个物理基准上展示方法有效性;摘要未提供定量结果,实验协议、消融及统计信息尚未验证。 平台推测(待验证):该方法可能用于具有明确安全或任务规范的 BCI 闭环外部设备控制,而非直接用于 EEG 解码。迁移假设是控制状态能够近似满足 Markov 性,且允许获得足够的交互样本;可复用模块包括规范自动机、抽象层策略学习及奖励塑形,需改造的是包含解码不确定性的状态表示与设备动力学接口。低信噪比、跨被试或通道变化可能造成状态混叠与非平稳性,小数据条件也可能使收敛保证难以转化为实际性能。可先在模拟辅助设备中固定任务规范与交互预算,对照稀疏奖励和塑形奖励,检验不同解码噪声下的规范满足率与学习速度。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其如何将连续状态系统的有界时域 scLTL 满足概率目标转化为无模型强化学习问题,并核对近似最优性保证与势函数奖励塑形的适用条件;其对 BCI 闭环控制的价值尚未验证。

来源:OpenReview · State space models · openreview.net