残差建模弥合机器人学习中回归策略与生成式策略的差距
Residual Modeling Closes the Regression and Generative Policy Gap in Robot Learning
基于摘要分析。本文重新考察机器人示范学习中直接动作回归与生成式策略的性能差距,提出异方差 Student-t 动作回归 HT-Policies,通过学习输入相关的残差尺度、降低重尾残差的影响,为生成式策略提供高效的直接回归替代方案。 机制与贡献:既有差距常被归因于示范的多模态性,本文转而分析动作预测残差如何影响优化。作者报告,真实机器人示范数据的残差尺度随状态显著变化,且尾部比高斯分布更重;MSE-Policies 与基于 diffusion 或 flow matching 的 Flow-Policies 均存在重尾动作残差,但训练梯度行为不同,MSE 会向大残差观测分配更多梯度幅度,作者认为这会损害优化。HT-Policies 学习输入相关的残差尺度,以减弱重尾样本的影响;它通过一次前馈计算预测动作块,并可复用预训练 flow-matching 策略网络作为骨干。具体损失形式、尺度参数化和骨干适配方式尚未验证。 评估证据:作者报告,在四个仿真基准及真实机器人评估中,无论从头训练,还是利用预训练 vision-language-action 与 world-action 模型,HT-Policies 的成功率均可与生成式策略基线竞争,同时训练和推理更快。摘要未提供基准名称、任务与数据划分、成功率数值、运行硬件或加速幅度,因此不能据此判断不同设置下的优势大小;实验协议、消融及统计信息尚未验证。 平台推测(待验证):可检验的迁移假设是,输入相关尺度建模与重尾稳健回归可能适用于连续 EEG 解码中的幅值不均和异常残差,但机器人动作回归中的有效性不等于 BCI 有效。可复用的是残差分布建模思路,需改造输入编码器及连续目标定义;低信噪比、跨被试尺度变化和小数据可能导致尺度估计不稳定,或将真实高幅响应误当作异常值。小规模实验可在同一连续 EEG 回归任务、固定被试内及跨被试划分下,使用相同骨干比较 MSE 与异方差 Student-t 目标,检验预测误差、残差分布及尺度稳定性。已有 EEG 相关工作尚未检索确认。
值得核对其残差统计与梯度分析:作者将直接回归与生成式机器人策略的性能差距联系到异方差和重尾残差,并提出单次前向推理的替代方案,但具体成功率、加速幅度及对照协议尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org