越晚越好:分布偏移下 ViT 的 token 缩减
Later Is Better: Token Reduction for ViTs Under Distribution Shift
基于摘要分析。研究关注无需训练的 ViT token 缩减在分布偏移下扩大准确率损失的问题,提出单参数、后期集中的幂律缩减调度,将更多 token 移除安排在较深层。作者报告,该调度相较均匀调度可改善分布外准确率,无需额外推理计算,也无需逐输入或逐域调参。 核心变量是 token 移除量沿网络深度的分布,而非单纯保留更多 token。作者报告,在与均匀调度保持相同计算量的对照中,后期调度累计移除更多 token,最终保留更少 token,但准确率仍更高。单层探测提示一种机制:较早缩减造成的特征扰动会经过更多后续层,因而使缩减误差在深度上前置;这一机制解释仍需结合全文中的探测设计核对。 在 ImageNet-C、DeiT-S 的评估中,作者报告,计算量降低 26% 时,后期调度相较均匀调度提高准确率 1.17 个百分点,弥合均匀调度与未压缩模型准确率差距的 83%;计算量降低 7% 时,提高 0.26 个百分点,弥合该差距的 99%。作者还报告效果覆盖 ToMe、EViT、ATS、ATC、PiToMe 五种 token 缩减方法、九种骨干、全部 ImageNet-C 扰动类型、另外八套分布偏移评估,以及视频和视觉语言 QA 两种其他模态。在干净数据上收益仍为正,随扰动严重程度升高而增大,在最高等级 5 时约为干净数据收益的四倍;结合六种测试时自适应方法时仍保持收益。具体评估划分、计算量口径、消融及统计信息尚未验证。 平台推测(待验证):若 EEG Transformer 同样通过跨层 token 缩减加速,可检验延后缩减是否有助于保留低信噪比信号中的判别信息。可复用调度思想,但需适配时间、通道或时频 token 的语义与压缩预算;跨被试差异、通道缺失及小数据条件可能改变误差传播规律。一个可证伪的小实验是在固定 EEG 模型上,以相同计算预算比较均匀与后期调度的跨被试表现,同时保留未压缩对照;视觉领域的收益不能视为 EEG/BCI 已验证效果,已有 EEG 相关工作尚未检索确认。
值得核对其等计算量下的 token 移除时序对照:作者报告,仅调整缩减的层深分布即可改善分布偏移下的准确率,为区分压缩强度与误差传播位置提供了可复现的研究切入点。
来源:arXiv · 泛化与分布偏移 · arxiv.org