SparseSSM:高效的选择性结构化状态空间模型可进行一次性剪枝
SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot
基于摘要分析。本文研究 Mamba 等状态空间语言模型的部署压缩问题,提出无需训练的一次性剪枝框架 SparseSSM,将经典 optimal brain surgeon(OBS)框架扩展至选择性状态空间模块(SSM)。主要贡献是针对状态转移矩阵的时间共享与离散化特性构建剪枝重要性估计,而非直接沿用面向注意力模块的方法。 机制方面,SparseSSM 采用逐层算法,汇聚各时间步的 Hessian 迹信息,推导近似二阶重要性分数;同时通过组件敏感性分析指导前馈网络(FFN)剪枝,以分析 Mamba 架构中的冗余分布。作者称该方法可扩展至半结构化和结构化稀疏,但摘要未给出具体稀疏模式、重要性计算公式或实现开销。 作者报告,在不微调、剪除 50% SSM 权重的条件下,零样本 Accuracy 未下降,并称其达到 Mamba 类大语言模型剪枝方法的当前最佳水平。该比例针对 SSM 权重,不能解释为整个模型参数减少 50%;摘要未提供模型规模、评估数据集、任务、对照方法及具体 Accuracy,因此无法核实最佳水平声明,也不能将参数稀疏率等同于实际推理加速。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 解码模型采用选择性 SSM,其跨时间共享参数的重要性估计可能用于模型压缩;可复用的是逐层二阶重要性估计思路,需改造的是任务评估、剪枝范围及重要性估计所依赖的数据采样。原研究依赖语言序列与 Mamba 架构,摘要未说明估计过程所需数据量或监督条件。EEG 的低信噪比、跨被试差异、通道变化与小数据可能使重要性估计不稳定,剪除对少数被试关键的参数。一个可检验的小实验是在固定跨被试划分的已有 EEG SSM 解码器上,对比 SparseSSM 与幅值剪枝,在相同剪枝范围及稀疏率下报告 Accuracy 和实际推理延迟,不将语言模型结果视为 BCI 有效性证据。已有 EEG 相关工作尚未检索确认。
值得阅读其针对时间共享、离散化状态转移矩阵设计的二阶剪枝重要性估计,但零样本精度保持的评估协议及其对 EEG 模型的适用性尚未验证。
来源:OpenReview · State space models · openreview.net