重新审视状态空间模型的 token 缩减
Rethinking Token Reduction for State Space Models
基于摘要分析。本文研究如何在训练后降低状态空间模型(SSMs)的 token 处理成本,核心问题是既有 token 缩减方法直接用于 SSMs 时会造成明显性能下降。作者提出面向 SSMs 的统一训练后 token 缩减方法,将 token 重要性与相似性结合,在层内实施细粒度剪枝和合并,以兼顾预测性能与资源开销。 原论文主要面向 Mamba 等通用序列模型的效率优化,并非 EEG 或 BCI 研究。摘要称作者分析了现有方法失效的原因及其局限,但未提供具体分析结论;重要性与相似性的计算方式、剪枝与合并的决策规则、对状态更新的处理,以及是否需要校准数据均尚未验证。“训练后”不宜进一步解读为完全不需要数据或额外优化。 作者报告,在使用 Mamba-2 的六个基准上,相较既有 token 缩减方法,平均 Accuracy 提升 5.7%–13.1%,同时显著降低计算需求和内存需求。摘要未说明该百分比是相对提升还是百分点差值,也未列出基准名称、数据划分、具体对照、压缩预算及资源测量条件,因此不能将其解释为相较未压缩模型的精度提升。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型以时间片段作为 token,并使用 Mamba 类骨干,该方法可能用于缓解长序列计算与内存瓶颈。假设 token 重要性与相似性能识别冗余片段,可复用剪枝与合并的总体策略;但需改造评分与合并规则以保留时间顺序、短暂事件及通道对应关系,其对监督、校准数据和训练规模的依赖需先核对全文。低信噪比可能使重要性估计失真,相似波形也未必代表相同任务信息,跨被试变化与小数据可能进一步放大风险。一个可检验的小实验是在固定 EEG 任务及跨被试划分下,以相同 token 保留预算比较未压缩模型、既有缩减方法与该方法,同时记录 Accuracy、推理延迟和峰值内存,检验收益是否成立。已有 EEG 相关工作尚未检索确认。
值得核对其针对 SSM 的层内 token 剪枝与合并机制,以及相同压缩预算下的精度、计算和内存权衡;摘要报告了对既有方法的改善,但尚不能据此判断 EEG 迁移效果。
来源:OpenReview · State space models · openreview.net