跳到正文
arXiv · 多模态与生成机制· Lilika Makabe; Heecheol Kim; Yasuyuki Matsushita·· 4 天前精选AI 评分75

ESP:用于单步多模态动作生成的 Energy-Score Policy

ESP: Energy-Score Policy for One-Step Multimodal Action Generation

AI 导读

基于摘要分析。本文研究机器人 vision-language-action(VLA)策略中的多模态动作生成:同一观测与指令可能对应多个有效动作序列,而 diffusion 和 flow matching 的迭代采样会增加闭环控制中的推理延迟。作者提出 ESP(Energy-Score Policy),无需教师模型,直接将策略上下文与噪声映射为动作块,仅需一次网络求值。 核心机制是用 energy score 而非均方误差训练动作头。均方误差回归倾向于学习条件均值,可能无法保留多个有效动作模式;energy score 则是严格适当的评分规则,其期望由目标分布唯一最小化。摘要中的精确分布恢复结论以模型能够表示目标分布、达到总体最优为前提,不能直接等同于有限数据和实际训练下的恢复保证。具体评分估计方式、网络结构与优化细节尚未验证。 作者报告,在仿真和真实机器人操控任务中,ESP 相比 flow matching 基线取得有竞争力的任务成功率,并显著降低动作生成延迟。摘要未提供任务名称、数据规模、成功率数值、硬件或延迟测量口径;实验协议、消融及统计信息尚未验证。复现时需核对基线采样设置、动作块长度、模型容量及计时边界,才能解释效率与任务表现的权衡。 平台推测(待验证):若 EEG 驱动的辅助控制需要输出连续动作,且同一神经信号上下文存在多个可接受动作,直接分布学习可能比条件均值回归更合适。可复用的是噪声条件动作头与 energy score 训练目标,需改造上下文编码器并依赖配对的 EEG—动作监督数据;低信噪比、跨被试差异和小样本可能导致模型把观测噪声误当作动作多样性。一个可检验的小实验是在固定 EEG 编码器和相同数据划分下,对比均方误差动作头、ESP 式动作头与 flow matching,分别检查动作有效性、多样性及相同硬件下的生成延迟。该假设不构成已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读的是 ESP 以严格适当的 energy score 直接学习多模态动作分布的机制,以及其相对 flow matching 的成功率与推理延迟权衡;具体实验协议和 BCI 迁移价值尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org