跳到正文
OpenReview · State space models· Zheng Zhan; Yushu Wu; Zhenglun Kong; Changdi Yang; Yifan Gong; Xuan Shen; Xue Lin; Pu Zhao; Yanzhi Wang·· 2024-01-01精选AI 评分74

重新审视状态空间模型的 token 缩减

Rethinking Token Reduction for State Space Models

AI 导读

基于摘要分析。本文研究如何在训练后降低状态空间模型(SSMs)的 token 处理成本,核心问题是既有 token 缩减方法直接用于 SSMs 时会造成明显性能下降。作者提出面向 SSMs 的统一训练后 token 缩减方法,将 token 重要性与相似性结合,在层内实施细粒度剪枝和合并,以兼顾预测性能与资源开销。 原论文主要面向 Mamba 等通用序列模型的效率优化,并非 EEG 或 BCI 研究。摘要称作者分析了现有方法失效的原因及其局限,但未提供具体分析结论;重要性与相似性的计算方式、剪枝与合并的决策规则、对状态更新的处理,以及是否需要校准数据均尚未验证。“训练后”不宜进一步解读为完全不需要数据或额外优化。 作者报告,在使用 Mamba-2 的六个基准上,相较既有 token 缩减方法,平均 Accuracy 提升 5.7%–13.1%,同时显著降低计算需求和内存需求。摘要未说明该百分比是相对提升还是百分点差值,也未列出基准名称、数据划分、具体对照、压缩预算及资源测量条件,因此不能将其解释为相较未压缩模型的精度提升。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型以时间片段作为 token,并使用 Mamba 类骨干,该方法可能用于缓解长序列计算与内存瓶颈。假设 token 重要性与相似性能识别冗余片段,可复用剪枝与合并的总体策略;但需改造评分与合并规则以保留时间顺序、短暂事件及通道对应关系,其对监督、校准数据和训练规模的依赖需先核对全文。低信噪比可能使重要性估计失真,相似波形也未必代表相同任务信息,跨被试变化与小数据可能进一步放大风险。一个可检验的小实验是在固定 EEG 任务及跨被试划分下,以相同 token 保留预算比较未压缩模型、既有缩减方法与该方法,同时记录 Accuracy、推理延迟和峰值内存,检验收益是否成立。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其针对 SSM 的层内 token 剪枝与合并机制,以及相同压缩预算下的精度、计算和内存权衡;摘要报告了对既有方法的改善,但尚不能据此判断 EEG 迁移效果。

来源:OpenReview · State space models · openreview.net