在猴目标搜索任务中测试的动态状态空间强化学习模型:扩展至任务事件学习
基于摘要分析。本研究面向灵长类生理实验使用的双目标搜索任务,研究强化学习模型如何利用试次历史,并将初始中央注视等任务事件纳入学习。作者在既有动态状态空间框架上提出“history-in-episode architecture”,将状态表示区分为 episode 与历史,使动作选择依赖各 episode 内的历史。 任务中,智能体需注视四个光点之一,两个相邻光点交替作为正确目标;达到一定次数的连续成功后,正确目标对切换。获得高概率奖励需要依据前两个试次的动作与结果作出决策。因此,研究的关键不是单次刺激到动作的映射,而是如何表示具有历史依赖和任务阶段结构的决策状态。摘要指出,既有动态状态空间能够处理前述历史依赖,而新架构旨在进一步支持包含初始中央注视等事件的任务。 作者报告,在该双目标搜索任务中,包含新架构与动态状态空间的模型表现接近理论最优;作为对照的 conventional SARSA 未能实现目标对切换,作者将其解释为该方法每次都需要重新学习正确目标。摘要未给出具体分数、理论最优的计算方式、训练规模或对照状态编码,不能据此推广为对所有 SARSA 实现的优势。动态状态空间的构建与更新规则、奖励设置、实验协议、消融及统计信息尚未验证。 该研究的主要对象是猴目标搜索任务的强化学习建模,不是 EEG 解码或 BCI 临床验证;摘要未提供猴行为与模型拟合的定量结果,也未说明使用神经信号训练或评估。其明确贡献在于任务事件与历史依赖的状态组织机制,原任务中的表现不构成 BCI 有效性的证据。已有 EEG 相关工作尚未检索确认。
阅读价值:值得阅读的具体原因是其将任务 episode 与 episode 内历史分开表示,并在需要跨试次记忆的目标搜索任务中与 conventional SARSA 对照;性能结论及动态状态空间的实现细节尚需全文核对。