状态空间模型训练中压缩的有趣现象
The Curious Case of In-Training Compression of State Space Models
基于摘要分析。本文研究 State Space Models(SSMs)中隐藏状态维度带来的表达能力与计算成本权衡,提出 CompreSSM:从较大的状态空间出发,在训练过程中识别并保留高影响维度,而非直接训练小维度模型。 核心机制来自控制理论中的 Hankel 奇异值分析与平衡截断。摘要指出,这一框架可衡量各状态的能量,并为系统降阶提供性能保证;CompreSSM 利用 Hankel 矩阵的特征值稳定性,在训练中进行状态空间压缩。但这些保证在训练过程及不同 SSM 类型中的具体适用条件尚未验证。方法适用于 Linear Time-Invariant SSMs,例如 Linear Recurrent Units;作者还表示可扩展至 selective models,具体扩展方式需查阅全文。 作者报告,在摘要所述实验中,训练中降阶显著加速优化,同时保留表达能力;与直接从较小状态维度开始训练的模型相比,先大后小的压缩模型能保留更多任务关键结构并获得更高性能。摘要未提供任务、数据集、压缩比例、计时口径或具体指标,因此尚不能量化收益,也不能判断该收益是否覆盖压缩本身的开销。实验协议、消融及统计信息尚未验证。材料提供了项目代码链接,但实现与复现条件尚未核验。 平台推测(待验证):其潜在 EEG 对应问题是长时间序列建模的状态更新成本,假设训练早期需要较大状态空间学习动态结构,而后期可压缩冗余状态。可复用部分是 SSM 状态重要性分析与训练中降阶流程;需针对 EEG 输入表征、通道组织及训练预算调整。低信噪比下,低能量状态不一定缺乏判别价值;被试差异、通道变化与小数据也可能使重要性估计不稳定。一个可检验的小实验是在固定 EEG 数据划分和训练预算下,对比大维度 SSM、直接训练的小维度 SSM 与最终维度相同的 CompreSSM,同时记录任务指标、训练耗时及压缩开销。已有 EEG 相关工作尚未检索确认。
值得核对 CompreSSM 如何利用 Hankel 奇异值分析在训练中筛选状态维度,以及其相对直接训练小维度 SSM 的性能与优化效率优势;其对 EEG 长序列建模的适用性尚未验证。
来源:OpenReview · State space models · openreview.net