无界状态空间中的稳定强化学习
Stable Reinforcement Learning with Unbounded State Space
基于摘要分析。该研究以排队网络调度为动机,研究无界状态空间中的强化学习(RL),提出使用 Sparse-Sampling-based Monte Carlo Oracle 的在线 RL 策略,并以系统状态是否能以高概率保持在有界区域内作为稳定性标准,而非仅以奖励衡量策略表现。 核心机制与理论贡献:作者认为,仅依赖有限样本训练的策略难以在整个无界状态空间中保持良好表现,因此需要在线训练。作者报告的理论结论是:若最优策略下的系统动力学满足 Lyapunov 函数条件,所提策略便具有稳定性,且策略本身无需知道该 Lyapunov 函数。作者进一步指出,Lyapunov 函数的存在与马尔可夫链的正常返性或稳定性具有对应关系,并据此说明该假设的适用性。具体条件、定理量词及证明细节尚未验证,不能将其概括为任意环境下的无条件稳定保证。 证据与复现边界:摘要未提供 Oracle 的具体实现、在线采样与更新规则、计算开销或实验结果。实验协议、消融及统计信息尚未验证;复现前需要核对状态与动作结构、环境交互或模拟访问要求,以及稳定性结论所依赖的动力学条件。本研究对象是无界状态空间中的控制问题,不是 EEG 状态空间建模或神经信号解码。 平台推测(待验证):其潜在关联限于具有明确动态状态和控制反馈的 BCI 闭环系统,可借鉴以稳定性而非单次奖励评估控制策略的思路。假设闭环过程能被合理建模为受控马尔可夫系统,并具备相应稳定性条件,才可能复用其分析框架;需改造的是状态估计、反馈动作与环境交互机制。EEG 的低信噪比、部分可观测性和跨被试变化可能破坏这些前提,小数据也可能限制在线采样。可先在具有已知稳定控制策略的简化闭环模拟器中加入观测噪声,对比所提策略与有限样本训练策略的状态越界频率及任务回报,检验该迁移假设。已有 EEG 相关工作尚未检索确认。
值得阅读其以 Lyapunov 条件分析在线 RL 策略稳定性的理论路径,但该保证针对无界状态空间系统,不等同于 EEG 解码性能或 BCI 闭环安全性保证。
来源:OpenReview · State space models · openreview.net