超越重建:机器人策略的动作分词中,什么才重要?
Beyond Reconstruction: What Matters in Action Tokenization for Robot Policies?
基于摘要分析。本文研究机器人自回归动作 token 策略中的分词器训练:如何将离散 token 序列转换为精确的连续控制动作,并使这一接口真正支持下游策略执行。作者提出 Predictable and Robust Action Tokenization(ProAct),在重建目标之外兼顾 token 的可预测性与解码鲁棒性,而非仅优化动作重建精度。 核心论点是,准确重建只是策略成功的一个条件:策略还需要根据新观测预测合适的 token,且未见过的策略 token 预测仍应解码为合理动作。作者认为,单独的重建目标并不直接激励这两种下游性质。ProAct 不依赖特定策略,仅使用动作数据集训练;摘要未披露增强目标的具体数学形式、训练流程或鲁棒性约束方式,不能据此确定其实现机制。 作者报告,在 Robomimic、LIBERO 和 RoboTwin 基准及多种分词器架构上,ProAct 的 rollout 成功率平均提高 11.3 个百分点;在视觉-语言-动作策略和真实机器人操作评估中,平均提升分别为 21.8 和 36.7 个百分点。这些数字对应不同评估场景,不宜直接比较;具体对照方法、任务构成、平均方式、数据划分及统计不确定性尚未验证。 本文的主要研究对象是机器人动作表示与策略接口,并非 EEG 解码或 BCI。摘要未提供足以确认其迁移到神经信号任务的具体机制,也未提供 BCI 有效性证据。复现前需核对完整训练目标、动作离散化与解码方式、策略训练配置,以及重建精度、可预测性和鲁棒性各自贡献的消融结果;实验协议、消融及统计信息尚未验证。
值得阅读的具体原因是作者将动作分词器的评价从重建精度扩展到下游 token 可预测性与解码鲁棒性,并报告跨机器人基准的任务成功率提升;具体训练机制及对照协议尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org