何时剪枝、剪去什么?面向高效 VLA 的阶段感知视觉 token 剪枝
When and What to Prune? Stage-Aware Visual Token Pruning for Efficient VLA
基于摘要分析。该研究针对 vision-language-action(VLA)模型推理中视觉 token 的计算开销,提出无需训练的 SAPrune:利用小规模校准集选择剪枝阶段,并结合高注意力 token 与周边上下文保护,减少过早剪枝造成的动作相关信息损失。 核心机制:固定层或均匀间隔剪枝可能在视觉观测与语言指令充分融合前丢弃后续动作预测所需的信息。SAPrune 在校准集上观察跨层的 action-to-visual attention 变化,待注意力模式更可靠后再选择剪枝层。在选定层内,双路径规则分别保护受到强关注的视觉 token,以及有用的周边上下文。摘要未给出可靠性的判定标准、上下文选择方式或具体剪枝配额,相关实现尚未验证。“无需训练”也不等于无需校准数据。 结果:作者报告,在 LIBERO、SIMPLER 及真实机器人任务的实验中,SAPrune 可剪去 87.5% 的视觉 token,实现最高 1.718 倍推理加速,同时保持有竞争力的任务成功率。摘要未明确这两个数值分别对应的模型、任务、对照基线及计时条件,也未提供成功率数值,不能据此认定所有任务均达到同等加速或性能无损。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其“先识别信息融合阶段、再做 token 剪枝”的思路可能适用于包含 EEG 时空 token 与任务条件交互的模型,但这只是迁移假设,原研究并未验证 BCI 效果。可复用部分是跨层注意力校准与重要 token 保护;需改造部分是 EEG 时空上下文定义及可靠性判据。低信噪比、通道差异和跨被试分布变化可能使注意力稳定性无法代表信息价值,小数据校准也可能失去代表性。可在已有 EEG 模型中,以相同 token 保留比例比较固定层剪枝与校准选层,记录任务指标和推理延迟,检验阶段选择是否有效;相关 EEG 工作尚未检索确认。
值得核对 SAPrune 如何利用校准集确定动作相关注意力的可靠阶段,以及上下文保护对剪枝后任务成功率的作用;摘要报告了推理加速,但具体协议与消融尚未验证。
来源:arXiv · 多模态与生成机制 · arxiv.org