跳到正文
OpenReview · State space models·· 22 天前精选AI 评分77

选择性状态空间模型的训练感知、免校准模型降阶

Training-Aware, Calibration-Free Model Reduction for Selective State Space Models

AI 导读

基于摘要分析。本文研究文本、音频等长序列任务中选择性状态空间模型(SSMs)的结构压缩,针对 Mamba 中影响逐步计算成本与参数量的状态阶数和步长调度维度,提出在全阶模型训练期间加入结构正则化、训练后一次性联合降维的框架。其贡献是仅利用学习到的参数构造目标维度模型,无需校准数据或压缩后微调。 机制上,作者以逐层有限时域输出误差界为依据,设计具有尺度不变性、考虑衰减特性的状态评分,以及步长映射的因子化低秩替代表示。训练完成后,通过状态选择降低状态阶数,通过截断 SVD 降低步长调度维度。这里的“免校准”指压缩阶段不需要校准数据,并不意味着训练不依赖数据;该方法将压缩准备纳入全阶训练过程,也不宜视为可直接用于任意现成模型的纯后处理方案。 作者报告,在 Selective Copying、SC09 和 The Pile 上,联合降维模型在相同降维水平下的点估计优于普通事后降维;仅降低状态阶数时,其免校准方法在 Selective Copying 和 SC09 上优于经适配的校准式基线,在 The Pile 上保持竞争力。摘要未提供具体指标、数值、模型规模或划分,不能据此判断优势大小、统计显著性及实际推理加速。实验协议、消融及统计信息尚未验证;复现还需核对正则化实现、目标维度设置、基线适配方式与计算开销。 平台推测(待验证):若 EEG 序列模型采用同类选择性 SSM,该机制可能用于减少长时间窗处理的状态与步长映射开销。可复用的是训练期结构约束和训练后降阶流程,需改造的是 EEG 输入表示、任务目标与误差评估。假设低能量但判别性强的神经信号可能被状态评分低估,低信噪比、跨被试差异及小数据训练也可能削弱降阶稳定性。可先在固定跨被试划分下,对比全阶模型、普通事后降阶和训练感知降阶,在匹配目标维度时检查任务指标与实测时延;原领域结果不构成 BCI 有效性的证据,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其训练期结构正则化与压缩后输出误差的联系,以及无需校准数据或压缩后微调的联合降维效果,但摘要中的点估计优势尚需结合完整协议与统计信息验证。

来源:OpenReview · State space models · openreview.net