跳到正文
OpenReview · State space models· Jorge Ramírez-Ruiz; Dmytro Grytskyy; Rubén Moreno-Bote·· 2022-01-01精选AI 评分81

寻求熵:占据动作—状态路径空间的内在动机如何产生复杂行为

Seeking entropy: complex behavior from intrinsic motivation to occupy action-state path space

AI 导读

基于摘要分析。本文研究不以奖励最大化为目标的智能体如何产生行为变异性与目标导向行为,提出最大占据原则:行为的目标是最大化未来动作与状态路径的占据,而奖励是维持路径探索的手段,并非最终目标。其主要研究对象是行为理论与智能体控制,并非 EEG 解码或 BCI 系统。 核心机制是以未来动作—状态路径熵表述内在动机。作者报告,在可加性及其他直观的预期路径占据性质要求下,动作—状态路径熵是唯一一致的度量;同时给出最优策略与状态价值函数之间的解析关系,并证明所提出价值迭代算法的收敛性。摘要未提供这些性质的完整定义、熵目标的具体形式、规划时域及收敛所需假设,尚不能据此等同于常见的策略熵正则化或最大熵强化学习。 作者报告,在离散和连续状态任务中,包括一个高维控制器,仅依靠占据路径空间的内在动机即可产生“跳舞”、捉迷藏和基本形式的利他行为。这些是任务内的行为展示,不能直接视为对真实动物行为机制的验证。任务规模、对照方法、定量指标、消融与统计信息尚未验证。 平台推测(待验证):该机制可能为 BCI 驱动的交互式控制提供探索目标,但并不直接解决神经信号解码问题。复用前提是能够定义可行动作、状态转移及未来路径空间;需改造的部分包括将解码不确定性和控制安全约束纳入状态与动作设计。低信噪比、跨被试差异或有限校准数据可能使解码噪声被误当作可探索的行为变化。一个可检验的小实验是在固定 EEG 解码器与同一控制环境下,对比路径熵目标和奖励目标,核对状态覆盖、任务完成与误操作是否存在权衡。相关 EEG 工作尚未检索确认,该建议不构成已验证的 BCI 效果。

阅读价值

值得阅读的是其将未来动作—状态路径占据转化为熵目标,并给出策略与价值函数关系及价值迭代收敛论证;这些理论结论的具体条件和实验表现仍需全文核对。

来源:OpenReview · State space models · openreview.net