跳到正文
OpenReview · State space models· Zheng Zhan; Yushu Wu; Zhenglun Kong; Changdi Yang; Yifan Gong; Xuan Shen; Xue Lin; Pu Zhao; Yanzhi Wang·· 2024-01-01精选AI 评分74

重新审视状态空间模型的 token 缩减

Rethinking Token Reduction for State Space Models

AI 导读

基于摘要分析。本文研究如何在训练后通过 token 缩减提高状态空间模型(SSMs)的效率,提出同时结合 token 重要性与相似性的统一方法,在层内进行细粒度裁剪与合并,以缓解现有 token 缩减方法直接用于 SSM 时的性能下降。 作者指出,Mamba 等采用选择性 SSM 的架构具备并行训练和长程依赖建模能力,但直接应用现有 token 缩减技术会导致明显性能损失。本文通过分析这一失效现象及已有方法的局限,设计面向 SSM 的训练后缩减策略。摘要未说明重要性和相似性的计算方式、裁剪与合并的分配规则,以及对状态更新的具体处理,相关机制需阅读全文核对。 作者报告,在使用 Mamba-2 的六个基准上,相较现有方法,平均 Accuracy 提升 5.7%–13.1%,同时显著减少计算与内存需求。摘要未列出基准名称、数据划分、对照方法、缩减预算和资源测量条件,也未明确该提升区间是相对百分比还是百分点,因此不能据此进一步换算或跨协议比较;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型以时间片段作为 token,且采用 Mamba 类 SSM,该方法可能用于降低长序列推理成本。可复用的候选部分是重要性与相似性联合驱动的缩减思路;需改造 token 表示及合并规则,以保留时间顺序和跨通道信息。低信噪比可能使重要性估计不稳定,相似片段合并也可能损伤短暂但关键的神经信号,跨被试变化与小数据条件会进一步增加风险。一个可检验的小实验是在固定 EEG 数据划分、模型权重及相同缩减预算下,对比不缩减、仅裁剪、仅合并与联合策略,同时记录 Accuracy、推理延迟和峰值内存。此建议不代表已验证的 BCI 效果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其针对 SSM 的训练后 token 裁剪与合并机制,重点核对状态传播与压缩策略的关系,以及在相同压缩预算下的准确率、计算和内存权衡;EEG 适用性尚未验证。

来源:OpenReview · State space models · openreview.net