跳到正文
OpenReview · State space models·· 22 天前精选AI 评分72

视觉状态空间模型 token 剪枝的简单方法

Simple approach to token pruning for vision state-space models

AI 导读

基于摘要分析。本文研究高分辨率图像下视觉状态空间模型的计算成本问题,提出无参数 token 剪枝重要性指标 DeltA,旨在以骨干已有信号筛选 token,而不引入可学习的剪枝模块。研究对象是视觉模型,并非 EEG/BCI 解码。 核心机制:Vision Mamba 虽具有线性序列复杂度,但高分辨率图像产生的大量 token 仍带来较高计算开销。与 Vision Transformers 不同,状态空间模型的计算具有递归与顺序依赖,移除 token 会改变后续状态更新,可能破坏沿序列的信息传播。DeltA 根据 token 的输入依赖时间尺度参数 Δ 与其经过 block 后的表征幅值之间的交互进行评分。摘要未提供具体评分公式、剪枝位置、保留比例或序列重组方式,尚不能判断该指标如何定量反映删去 token 后的状态变化。 作者报告,在 ViM 和 PlainMamba 架构上的图像分类、语义分割与面部属性识别实验中,该方法获得了有利的准确性—计算量权衡,并显示同一评分准则可用于不同视觉 Mamba 架构与任务。摘要未给出数据集、数据划分、对照方法、具体指标或数值;实验协议、消融及统计信息尚未验证。复现时需核对剪枝是否需要重新训练,以及计算量降低能否转化为实际推理延迟和内存收益。 平台推测(待验证):若 EEG 状态空间模型将时间片段编码为有序 token,利用 Δ 与表征幅值进行筛选可能缓解长序列计算开销。这一假设依赖骨干能够提供相应信号;评分思路可复用,但时间切片、通道组织及剪枝策略需要适配。低信噪比下,较大幅值可能来自伪迹,而短暂但关键的 ERP 信息也可能被误删;跨被试差异、小数据条件可能进一步影响评分稳定性。可在一个固定 EEG 任务和相同数据划分下,对比不剪枝、均匀剪枝与 DeltA 剪枝,在相同 token 保留比例下检验任务指标、实际延迟及关键时段保留情况。已有 EEG 相关工作尚未检索确认。

阅读价值

DeltA 利用骨干已有信号构造无参数剪枝指标,针对状态空间模型的递归与顺序依赖提出视觉 token 筛选方法,值得核对其剪枝位置、实际计算收益及信息传播保留效果;其 EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net