跳到正文
OpenReview · State space models· Rom N. Parnichkun; Stefano Massaroli; Alessandro Moro; Jimmy T. H. Smith; Ramin M. Hasani; Mathias Lechner; Qi An; Christopher Ré; Hajime Asama; Stefano Ermon; Taiji Suzuki; Atsushi Yamashita; Michael Poli·· 2024-01-01精选AI 评分80

状态空间模型的无状态推理:传递函数方法

State-Free Inference of State-Space Models: The Transfer Function Approach

AI 导读

基于摘要分析。本文研究深度学习状态空间模型的高效序列计算,通过其对偶表示——传递函数——设计频域参数化,并提出无需显式状态的序列并行推理算法。核心贡献是直接计算对应卷积核的频谱,降低状态规模增大带来的计算与内存开销。 机制上,作者利用所提出的频域传递函数参数化性质,通过一次 Fast Fourier Transform(FFT)得到对应卷积核的频谱。作者称,无状态推理不会随着状态规模增加而产生显著的额外内存或计算成本;这一表述不等于整体计算成本为零,也不能据此认定其支持同样高效的逐样本在线推理。参数化的具体形式、数值稳定性及训练与推理的实现细节尚未验证。 结果方面,作者报告:在 Long Range Arena 上,跨多个序列长度与状态规模的实验中,相对采用时域参数化的 S4 层,平均训练速度提升 35%,并在所比较的无注意力方法中取得作者所称的领先下游表现。摘要未提供具体任务分项、绝对分数、硬件与计时条件,不能据此比较不同协议的性能。作者还报告,在语言建模中,仅引入该传递函数参数化即可相对长卷积 Hyena 基线改善 perplexity,但未给出数值。摘要提供了代码地址;实验协议、消融及统计信息尚未验证。 平台推测(待验证):迁移假设是,若 EEG 长序列建模确实受状态规模相关开销限制,该参数化与卷积计算模块可能具有复用价值,但仍需适配多通道输入与任务监督。低信噪比、通道差异和小样本可能使计算优势无法转化为解码收益。可在固定数据划分、输入长度、硬件与训练预算下,对照 S4 比较训练吞吐量、峰值显存及同一任务指标,并随序列长度与状态规模变化检验该假设;这不是已证实的 BCI 效果,已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其传递函数参数化如何降低大状态规模下的序列并行计算开销,以及作者报告的相对 S4 训练提速能否在相同实现与评估条件下复现;其对 EEG 长序列建模的价值尚未验证。

来源:OpenReview · State space models · openreview.net