模板模型启发的任务空间学习用于鲁棒双足行走
Template Model Inspired Task Space Learning for Robust Bipedal Locomotion
基于摘要分析。本文研究机器人双足行走,将基于 Reinforcement Learning(RL)的高层规划策略与基于模型的低层控制器结合:前者在线生成任务空间指令,后者跟踪期望任务空间轨迹,目标是在保持步态稳定性的同时提高学习效率与鲁棒性。 核心机制是利用基于角动量的线性倒立摆(ALIP)模型启发 Markov Decision Process(MDP)的观测空间与动作空间设计,而非直接采用端到端学习。高层策略建立低维动力学状态到塑造步态的任务空间输出之间的映射;摘要称该策略不依赖特定的低层任务空间控制器,使规划与控制模块可以分开设计。这一结构的主要阅读价值在于物理先验如何进入策略接口,而不是将其视作通用序列 State Space Model。 作者报告在三类机器人上测试了分层控制器:五连杆欠驱动平面双足机器人 Rabbit、七连杆全驱动平面双足机器人 Walker2D,以及具有 20 个驱动关节的三维人形机器人 Digit。作者报告,相较 ALIP 模型方法及先进的学习式双足行走框架,该方法在性能、数据效率和鲁棒性方面有所改善;训练后的策略能够形成类人行走行为、跟踪较宽范围的行走速度,并在对抗条件下保持稳定。摘要未提供具体指标、提升幅度、训练预算或对抗条件定义,这些结果不能据此作定量比较。 复现时需核对 ALIP 状态与任务空间动作的具体定义、奖励与训练流程、低层控制器配置、各机器人是否独立训练,以及对照方法和扰动测试是否采用一致条件;实验协议、消融及统计信息尚未验证。本文主要对象是机器人运动控制,材料未提供 EEG 或 BCI 验证,也未建立可直接复用到神经信号解码的具体机制路径,因此不据此提出 BCI 迁移效果或复现实验建议。已有 EEG 相关工作尚未检索确认。
值得阅读的是以 ALIP 模板模型约束高层策略的状态与动作设计、并将任务空间规划与低层控制解耦的具体机制,但作者报告的效率与鲁棒性优势仍需结合全文实验协议核对。
来源:OpenReview · State space models · openreview.net