跳到正文
OpenReview · State space models· Qiong Liu; Ye Guo; Lirong Deng; Haotian Liu; Dongyu Li; Hongbin Sun·· 2022-01-01精选AI 评分72

缩小动作空间:用于基于逆变器的电压—无功控制的参考模型辅助深度强化学习

Reducing Action Space: Reference-Model-Assisted Deep Reinforcement Learning for Inverter-based Volt-Var Control

AI 导读

基于摘要分析。本文研究有源配电网中的基于逆变器的电压—无功控制(IB-VVC),提出参考模型辅助深度强化学习(DRL):不直接学习最优动作,而是学习参考动作与最优动作之间的残差,以缩小连续动作空间并降低学习难度。其主要研究对象是电力系统控制,而非神经信号解码或 BCI。 核心机制是利用参考模型及基于该模型的优化产生参考动作,再由 DRL 学习动作修正。作者认为,相对于直接学习的最优动作,残差动作幅度更小,因此可以设置更小的动作空间。作者称该方法兼容连续动作问题中的策略梯度 DRL 算法,并以 soft actor-critic 为例构建参考模型辅助算法。参考模型的具体形式、残差范围的确定方式、损失与训练流程尚未验证。 作者报告,在所研究的 IB-VVC 仿真中,较大的动作空间会在整个训练阶段降低 DRL 性能;参考模型辅助方法需要更少迭代,并取得更好的优化表现。摘要未提供具体数值,仿真网络、运行场景、对照配置、优化指标、消融及统计信息尚未验证,不能据此判断改进幅度或其他控制场景中的效果。 平台推测(待验证):若某类 BCI 连续闭环控制已有可用的参考控制器,该机制可能用于学习相对参考动作的小幅修正,而不是替代 EEG 解码器。其依赖可交互的控制环境、奖励反馈与足够可靠的参考动作;可复用残差策略框架,但需改造状态表示、奖励、动作边界及安全约束。低信噪比、跨被试差异和小数据可能使参考动作偏差增大,过窄的残差空间反而限制纠错。可先在离线或仿真闭环环境中,以相同数据预算比较直接动作学习与参考动作加残差学习,并检验参考模型失配时的收益是否保留;已有 EEG 相关工作尚未检索确认。

阅读价值

值得关注其以参考模型动作加残差学习缩小连续控制动作空间的机制,但性能证据仅来自电力配电网仿真,对 BCI 闭环控制的适用性尚未验证。

来源:OpenReview · State space models · openreview.net