VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 裁剪
VLA-ACL: Action-Consistent Visual Token Pruning for Efficient Vision-Language-Action Models
基于摘要分析。该研究面向机器人操控中的 Vision-Language-Action(VLA)模型,解决每个控制步骤处理长视觉 token 序列所带来的计算开销。VLA-ACL(Action Consistency Learning)在完全冻结基础 VLA 模型的条件下,利用动作层面的监督学习轻量视觉 token 裁剪策略,将 token 选择直接关联到下游控制输出。 核心机制是让裁剪视觉上下文后生成的动作与完整视觉上下文教师生成的动作保持一致,并以真实动作作为辅助监督。其区别于摘要所述依赖注意力分数、运动阈值等间接启发式的免训练裁剪方法,也不要求微调基础 VLA 模型。具体裁剪策略结构、动作一致性损失形式、辅助监督权重及训练开销尚未验证。 作者报告,在 LIBERO 与真实世界机器人操控任务的实验中,视觉 token 最多裁剪 87.5%,同时保持有竞争力的任务表现;计算量最多降低 75%,推理速度达到 1.5 倍。摘要未明确这些结果各自对应的模型、任务、硬件及配置,不能将各项最高值视为同一实验条件下同时实现。作者报告,其性能—效率权衡优于现有冻结 VLA 的裁剪方法;具体任务指标、对照基线、数据划分、消融及统计信息尚未验证。 复现需核对完整上下文教师的构建方式、真实动作监督来源、裁剪策略训练成本,以及推理加速是否包含 token 选择开销。摘要提供了代码仓库地址,但代码内容与可运行性尚未验证。本研究的主要对象是机器人视觉—语言—动作控制,材料未提供 EEG 或 BCI 验证;不能据此认定对神经信号解码有效,相关工作尚未检索确认。
值得核对其冻结基础 VLA、以动作一致性学习视觉 token 裁剪策略的性能—效率权衡,但摘要中的最高压缩与加速结果是否对应同一配置尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org