受模板模型启发的任务空间学习:面向鲁棒双足行走
Template Model Inspired Task Space Learning for Robust Bipedal Locomotion
基于摘要分析。该研究面向双足机器人行走控制,提出分层框架:由基于 Reinforcement Learning(RL)的高层规划策略在线生成任务空间指令,再由基于模型的低层控制器跟踪目标任务空间轨迹。核心贡献是利用 angular momentum-based linear inverted pendulum(ALIP,基于角动量的线性倒立摆)指导学习问题设计,而非采用传统端到端学习。 技术上,ALIP 为 Markov Decision Process(MDP)的观测空间与动作空间设计提供依据,使高层策略建立低维动力学状态到塑造步态的任务空间输出之间的映射。摘要称高层策略不依赖特定任务空间低层控制器,因此可提高控制器选择的灵活性及框架向其他双足机器人的泛化能力;但具体状态变量、动作参数化、奖励函数、训练算法及控制接口尚未验证。 作者报告,该分层框架相较 ALIP 模型驱动方法和先进学习式双足行走框架,在性能、数据效率与鲁棒性方面有所改善。测试对象包括 Rabbit(五连杆欠驱动平面双足机器人)、Walker2D(七连杆全驱动平面双足机器人)和 Digit(具有 20 个驱动关节的三维人形机器人)。作者报告,训练后的策略可自然形成类似人类的行走行为,跟踪较宽范围的行走速度,并在对抗条件下保持步态鲁棒性与稳定性。摘要未提供具体指标、速度范围、对抗条件、训练数据量或各基线的比较协议,不能据此量化提升,也不能将多机器人测试直接解释为同一策略的零样本迁移。 该工作的主要对象是机器人动力学与行走控制,并非 EEG/BCI 信号建模;ALIP 在此是物理模板模型,不应因来源栏目为 State space models 而将其归为神经信号状态空间序列模型。现有材料未建立具体 EEG/BCI 方法对应关系,因此不提出迁移效果或复现实验建议。复现前需核对各机器人训练与测试设置、低层控制器实现、基线配置、消融及统计信息;这些内容目前尚未验证。
值得阅读的是其利用 ALIP 为高层 RL 设计低维状态与任务空间动作,并将规划与底层轨迹控制解耦的机制;作者报告的效率与鲁棒性优势仍需结合全文实验协议核对。
来源:OpenReview · State space models · openreview.net