跳到正文
OpenReview · State space models· Kaiwen Tuo; Huan Wang·· 2026-05-01精选AI 评分75

SparseSSM:高效选择性结构化状态空间模型可进行一次性剪枝

SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot

AI 导读

基于摘要分析。本文研究 Mamba 等状态空间语言模型的部署成本,提出免训练的一次性剪枝框架 SparseSSM,将经典 optimal brain surgeon(OBS)框架扩展到状态空间架构。主要贡献是针对选择性状态空间模块(SSM)中时间共享且经过离散化的状态转移矩阵设计剪枝估计,而非仅沿用通用线性层或注意力模块的处理方式。 机制上,作者采用逐层算法,推导跨时间步聚合 Hessian 迹信息的近似二阶重要性分数,并通过组件敏感性分析指导前馈网络(FFN)剪枝,以分析 Mamba 架构中的冗余分布。作者称该框架可扩展至半结构化及结构化稀疏,也可推广至其他基于 SSM 的架构;具体推导、近似条件与推广实验尚未验证。 作者报告,在 Mamba-based LLMs 上剪除 50% 的 SSM 权重且不进行微调时,性能下降有限,并声称达到该类模型一次性剪枝的当前最佳水平。摘要未提供模型规模、数据集、评估指标、具体性能变化或对照方法,因此不能据此量化效果或确认优势。实验协议、消融及统计信息尚未验证;权重稀疏率也不能直接等同于推理加速或显存节省。 平台推测(待验证):若 EEG 解码器采用类似的选择性 SSM,其跨时间步重要性估计可能用于压缩时序模型,缓解部署资源限制。可复用的是逐层重要性估计与组件敏感性分析,需改造的是校准数据与 EEG 任务的误差评估;摘要未说明这些估计依赖何种数据、监督或样本规模。低信噪比、通道差异及小数据可能使重要性估计不稳定,跨被试变化也可能令校准阶段不重要的状态在测试时变得关键。可检验的小实验是在固定跨被试划分的 EEG SSM 解码器上,以相同稀疏率比较 SparseSSM 与幅值剪枝,测量原任务指标变化及实际推理延迟,不预设其有效。相关 EEG 剪枝工作尚未检索确认。

阅读价值

值得核对其针对时间共享、离散化状态转移矩阵设计的二阶剪枝重要性估计,以及免微调稀疏化的性能代价;其在 EEG 模型上的适用性尚未验证。

来源:OpenReview · State space models · openreview.net