跳到正文
OpenReview · State space models· Ozan Çatal; Samuel Wauthier; Cedric De Boom; Tim Verbelen; Bart Dhoedt·· 2020-01-01精选AI 评分77

用于主动推断的生成式状态空间模型学习

Learning Generative State Space Models for Active Inference

AI 导读

基于摘要分析。本文研究人工智能体如何通过主动推断实现自主行为,核心贡献是利用深度人工神经网络,仅从观测—动作序列中学习生成式状态空间模型,替代通常需要手工构建的生成模型。研究对象是控制与机器人导航,而非 EEG 解码或 BCI。 主动推断框架以最小化自由能或预测误差组织智能体的观测与行动。本文将可学习的生成式状态空间模型引入该框架,以支持更复杂的观测和任务。摘要未给出模型结构、状态表示、具体损失、训练流程及策略计算细节,这些尚未验证;也不能将其与其他同名状态空间模型架构直接等同。 作者报告,在 mountain car 问题中,学得的模型能够权衡工具性价值与歧义;在 OpenAI Gym car racing 环境和真实机器人导航任务中,也能从高维像素观测学习生成模型。作者还报告,基于主动推断的策略在所评估的强化学习任务上,相比 Deep Q Networks 具有高一个数量级的样本效率。该结果的具体任务范围、样本计量方式、数据划分、基线配置、消融及统计信息尚未验证,不能据此推断普遍优势。 平台推测(待验证):可检验的迁移假设是,将神经信号观测与反馈动作组成时序数据,学习潜在状态及动作相关的观测变化,用于研究闭环 BCI 中的不确定性与行动选择。可复用的是生成式状态建模和主动推断思路;观测模型、动作语义与目标偏好需针对 EEG 改造。其依赖具有对应关系的观测—动作序列,普通离线分类数据未必满足这一条件;低信噪比、通道变化、跨被试差异和小数据可能使潜在状态难以辨识。一个小规模检验可在具有反馈记录的单被试闭环任务中,用独立会话评估观测预测与控制表现,并与匹配训练数据预算的基线比较。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是其从观测—动作序列学习生成式状态空间模型、减少主动推断对手工模型依赖的机制;作者报告了控制与导航任务验证,但其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · State space models · openreview.net