重新审视状态空间模型的 token 缩减
Rethinking Token Reduction for State Space Models
基于摘要分析。本文研究如何在训练后通过 token 缩减提高状态空间模型(SSMs)的效率,提出同时结合 token 重要性与相似性的统一方法,在层内进行细粒度裁剪与合并,以缓解现有 token 缩减方法直接用于 SSM 时的性能下降。 作者指出,Mamba 等采用选择性 SSM 的架构具备并行训练和长程依赖建模能力,但直接应用现有 token 缩减技术会导致明显性能损失。本文通过分析这一失效现象及已有方法的局限,设计面向 SSM 的训练后缩减策略。摘要未说明重要性和相似性的计算方式、裁剪与合并的分配规则,以及对状态更新的具体处理,相关机制需阅读全文核对。 作者报告,在使用 Mamba-2 的六个基准上,相较现有方法,平均 Accuracy 提升 5.7%–13.1%,同时显著减少计算与内存需求。摘要未列出基准名称、数据划分、对照方法、缩减预算和资源测量条件,也未明确该提升区间是相对百分比还是百分点,因此不能据此进一步换算或跨协议比较;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型以时间片段作为 token,且采用 Mamba 类 SSM,该方法可能用于降低长序列推理成本。可复用的候选部分是重要性与相似性联合驱动的缩减思路;需改造 token 表示及合并规则,以保留时间顺序和跨通道信息。低信噪比可能使重要性估计不稳定,相似片段合并也可能损伤短暂但关键的神经信号,跨被试变化与小数据条件会进一步增加风险。一个可检验的小实验是在固定 EEG 数据划分、模型权重及相同缩减预算下,对比不缩减、仅裁剪、仅合并与联合策略,同时记录 Accuracy、推理延迟和峰值内存。此建议不代表已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。
值得阅读其针对 SSM 的训练后 token 裁剪与合并机制,重点核对状态传播与压缩策略的关系,以及在相同压缩预算下的准确率、计算和内存权衡;EEG 适用性尚未验证。
来源:OpenReview · State space models · openreview.net