跳到正文
OpenReview · State space models· Lorenzo Jamone; Lorenzo Natale; Kenji Hashimoto; Giulio Sandini; Atsuo Takanishi·· 2011-01-01精选AI 评分73

通过目标驱动探索学习任务空间控制

Learning task space control through goal directed exploration

AI 导读

基于摘要分析。本文研究冗余机器人如何自主学习任务空间控制,提出以任务空间目标驱动探索、在线学习前向模型并将其求逆用于控制的策略,强调学习与执行不分离。其主要研究对象是仿真人形机器人的三维目标到达动作,而非 EEG 解码或 BCI 算法。 机制上,机器人通过尝试完成任务空间中的目标动作来探索状态空间,而不是先在关节空间进行 motor babbling(运动试探)。前向模型用于建立机器人运动与任务空间结果之间的关系,再通过模型求逆生成控制。摘要提及比较了不同的前向模型学习方法,但模型形式、求逆算法、在线更新规则及比较设置尚未验证;来源栏目名称不足以将其认定为现代 State Space Model 架构。 作者报告,在仿真人形机器人实验中,系统利用手臂与腰部运动自主学习面向三维目标的到达动作,不依赖先验知识或初始运动试探。为考察对机器人结构及感知环境突变的适应,实验分别引入连杆长度修改与任务空间参考系旋转两类运动学扰动;作者报告,模型的在线更新使机器人能够应对这些变化。摘要未给出到达误差、适应速度或具体对照结果,实验协议、消融及统计信息尚未验证,不能据此评价其相对性能或真实机器人适用性。 平台推测(待验证):该机制可能与 BCI 驱动外部机械臂的控制端有关,即以目标及执行反馈持续修正执行器模型;这不等于解决 EEG 低信噪比或跨被试解码问题。可复用部分是目标驱动探索与在线前向模型更新,需改造部分是神经解码指令到控制动作的接口、安全约束及反馈处理。其可用性依赖可观测的动作结果与充分探索,噪声指令、反馈延迟及少量交互数据可能使模型求逆不稳定。可检验的小实验是在相同固定解码器和仿真目标序列下,对比冻结与在线更新的执行器模型在参考系扰动后的到达误差和恢复所需交互次数;该实验仅检验控制端适应,不验证神经解码改善。已有 EEG/BCI 相关工作尚未检索确认。

阅读价值

值得核对其任务空间目标驱动探索与前向模型在线更新机制,尤其是模型在机器人连杆长度及任务空间参考系变化后如何恢复控制;摘要中的证据限于仿真人形机器人,尚不支持 BCI 有效性结论。

来源:OpenReview · State space models · openreview.net