跳到正文
热点事件观察中

HT-Policies:稳健机器人动作回归

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

基于摘要分析。该成果(arXiv:2610.12231)重新考察直接动作回归与生成式机器人策略的性能差距,将关注点从示范多模态性转向残差对优化的影响。作者报告,真实机器人示范的残差尺度随状态变化,且具有重尾;提出异方差Student-t回归,学习输入相关尺度、减弱重尾残差影响,以单次前馈预测动作块,并可复用预训练flow-matching骨干。 作者报告,在四个仿真基准及真实机器人评估中,从头训练或基于预训练VLA、world-action模型训练时,成功率可与生成式基线竞争,训练和推理更快。摘要未列基准名称、数据划分、成功率数值、硬件及加速幅度;具体损失、消融和统计可靠性尚未验证。 本次新增摘要报道,未提供可核对的论文版本变化。平台分析:现有证据不足以判定优势大小或向BCI迁移的有效性。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · 多模态与生成机制精选
    残差建模弥合机器人学习中回归策略与生成式策略的差距

    基于摘要分析。本文重新考察机器人示范学习中直接动作回归与生成式策略的性能差距,提出异方差 Student-t 动作回归 HT-Policies,通过学习输入相关的残差尺度、降低重尾残差的影响,为生成式策略提供高效的直接回归替代方案。 机制与贡献:既有差距常被归因于示范的多模态性,本文转而分析动作预测残差如何影响优化。作者报告,真实机器人示范数据的残差尺度随状态显著变化,且尾部比高斯分布更重;MSE-Policies 与基于 diffusion 或 flow matching 的 Flow-Policies 均存在重尾动作残差,但训练梯度行为不同,MSE 会向大残差观测分配更多梯度幅度,作者认为这会损害优化。HT-Policies 学习输入相关的残差尺度,以减弱重尾样本的影响;它通过一次前馈计算预测动作块,并可复用预训练 flow-matching 策略网络作为骨干。具体损失形式、尺度参数化和骨干适配方式尚未验证。 评估证据:作者报告,在四个仿真基准及真实机器人评估中,无论从头训练,还是利用预训练 vision-language-action 与 world-action 模型,HT-Policies 的成功率均可与生成式策略基线竞争,同时训练和推理更快。摘要未提供基准名称、任务与数据划分、成功率数值、运行硬件或加速幅度,因此不能据此判断不同设置下的优势大小;实验协议、消融及统计信息尚未验证。 平台推测(待验证):可检验的迁移假设是,输入相关尺度建模与重尾稳健回归可能适用于连续 EEG 解码中的幅值不均和异常残差,但机器人动作回归中的有效性不等于 BCI 有效。可复用的是残差分布建模思路,需改造输入编码器及连续目标定义;低信噪比、跨被试尺度变化和小数据可能导致尺度估计不稳定,或将真实高幅响应误当作异常值。小规模实验可在同一连续 EEG 回归任务、固定被试内及跨被试划分下,使用相同骨干比较 MSE 与异方差 Student-t 目标,检验预测误差、残差分布及尺度稳定性。已有 EEG 相关工作尚未检索确认。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。