跳到正文
OpenReview · State space models· Yan Ru Pei·· 2025-01-01精选AI 评分77

让 SSM 成为 ConvNet:基于最优张量收缩的状态空间建模

Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions

AI 导读

基于摘要分析。本文研究原始音频处理中的状态空间模型(SSM)网络设计与训练效率,提出 Centaurus:将广义 SSM 块的训练运算表示为张量收缩,并为各块系统确定最优收缩顺序,从而拓展传统深度可分离 SSM 的结构选择。 核心机制是把计算执行顺序与块结构设计结合起来。作者借鉴经典卷积块中的分组卷积、完整卷积及瓶颈结构,构建由不同类型 SSM 块混合组成的异构网络,以权衡网络规模、任务性能,以及训练和推理的内存与计算效率。这里的卷积设计启发不等于网络必须使用显式 CNN 运算;具体参数化、收缩顺序的优化目标与搜索过程尚未验证。 作者报告,在关键词识别、语音去噪和自动语音识别(ASR)任务上,异构 Centaurus 优于其同构对照网络。摘要未提供数据集、数据划分、评价指标、数值结果及对照的资源匹配条件,因此不能量化优势。作者还声称,Centaurus 是首个具有竞争性 ASR 性能、且可完全由状态空间运算构成的网络,无需非线性递归(如 LSTM)、显式卷积或替代性注意力机制;这一首次性与性能表述仍需结合全文及相关工作核对。实验协议、消融及统计信息尚未验证。摘要称代码作为补充材料提供,但实现与复现条件尚未核验。 平台推测(待验证):可迁移的假设主要是计算与结构设计,而非已经证实的 EEG 表征优势。原方法依赖序列数据及具体 SSM 参数化;任务监督、序列长度和训练规模尚不明确。若 EEG 中的时间建模与多通道混合构成计算瓶颈,可尝试复用张量收缩优化和异构块组合,但需改造输入通道组织、输出头及训练协议。低信噪比、跨被试差异、通道变化与小数据可能使音频任务上的优势失效。一个可证伪的小实验是在固定 EEG 任务和相同跨被试划分下,以匹配参数量及训练预算的同构 SSM 为对照,比较异构设计的任务指标、训练耗时与峰值显存。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对其如何通过张量收缩顺序优化扩展 SSM 块的设计空间,以及异构块组合相对同构网络的性能与资源权衡;摘要中的音频结果尚不能作为 EEG/BCI 有效性的证据。

来源:OpenReview · State space models · openreview.net