在猴目标搜索任务上测试的动态状态空间强化学习模型:基于经验饱和与决策唯一性自主确定历史状态
Reinforcement Learning Model With Dynamic State Space Tested on Target Search Tasks for Monkeys: Self-Determination of Previous States Based on Experience Saturation and Decision Uniqueness
基于摘要分析。该研究针对强化学习通常预先给定状态空间、难以适应事先无法完整界定的环境这一问题,提出根据经验饱和(experience saturation)与动作选择的决策唯一性(decision uniqueness)动态扩展状态空间的方法。主要研究对象是强化学习智能体在此前用于猴的目标搜索任务中的行为适应,而非 EEG 解码或 BCI 控制。 任务包含四个相邻位置,其中两个位置交替成为正确目标;在利用阶段连续正确若干次后,有效位置对发生切换,智能体需在探索阶段寻找新的位置对。摘要指出,仅依据前一试次不足以获得最大回报,需要结合前两个试次选择动作。模型不预先获知这一任务结构,而是依据上述两项判据扩展历史状态表示,使决策能够参考多个试次。判据的数学定义、状态扩展流程及学习更新规则尚未验证。 作者报告,在该目标搜索任务中,模型表现可比于预先获知任务结构的理想模型;在模型开发时未预设的另一项任务上也表现良好。作者还报告模型学会了合理搜索,并称其未陷入探索与利用的权衡困境。摘要未提供具体指标、数值、另一任务的细节或统计依据,因此这些结论的适用范围需结合全文核对。实验协议、消融及统计信息尚未验证;该摘要也不足以确认模型与猴行为数据的拟合程度。 平台推测(待验证):可检验的迁移假设是,这种按历史经验扩展状态表示的机制,可能适用于具有延迟反馈或历史依赖的 BCI 交互控制,而不直接解决 EEG 信号特征提取。可复用部分是状态扩展判据;需改造的是神经信号到状态的映射及反馈定义。低信噪比、跨被试与跨通道差异可能被误判为历史依赖,小数据则可能使经验饱和难以可靠判断。小规模验证可在固定 EEG 解码输出的历史依赖控制仿真中,对比固定单步、固定双步与动态历史状态策略,在一致反馈预算和噪声条件下检验回报与状态规模。已有 EEG 相关工作尚未检索确认。
值得阅读的具体机制是以经验饱和与动作选择的决策唯一性为判据,自适应扩展历史状态表示;作者报告了任务适应能力,但其对 EEG/BCI 的价值尚未验证。
来源:OpenReview · State space models · openreview.net