让 SSM 成为 ConvNet:基于最优张量收缩的状态空间建模
Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions
基于摘要分析。本文研究原始音频处理中的状态空间模型(SSM)设计与计算效率,提出 Centaurus:将广义 SSM 块的训练运算表示为张量收缩,并系统确定各块的最优收缩顺序,以扩大结构设计空间、兼顾性能与资源开销。 核心机制是突破常见的深度可分离配置,借鉴经典卷积块中的分组卷积、全卷积与瓶颈结构,设计不同类型的 SSM 块。Centaurus 混合使用这些块,目标是在网络规模、任务性能以及训练和推理的内存与计算效率之间取得平衡。摘要未给出具体状态更新方程、张量维度、收缩顺序搜索方法或训练损失,尚不能判断优化过程的额外成本及其硬件依赖。 作者报告,在关键词识别、语音去噪和自动语音识别(ASR)等原始音频任务中,异构网络优于同构网络。作者还声称,Centaurus 是首个具备竞争力且可完全基于状态空间构建的 ASR 网络,不使用 LSTM 等非线性递归、显式 CNN 卷积或替代注意力机制。这些结论的具体数据集、划分、基线、指标、资源测量、消融及统计信息尚未验证;摘要未提供可核对的数值。 平台推测(待验证):其潜在 EEG 价值在于结合时序建模与更灵活的通道交互,而不是音频结果本身证明了 BCI 有效性。该假设依赖多通道时序结构及足够的任务训练数据;可复用广义 SSM 块与收缩优化思路,但需改造输入通道组织和任务输出。EEG 的低信噪比、通道配置差异、跨被试分布变化及小数据规模可能使复杂通道交互过拟合。一个可检验的小实验是:在固定 EEG 数据划分、预处理和近似参数预算下,对比同构深度可分离 SSM 与异构 SSM,分别核对任务指标、训练时间和峰值显存;被试内与跨被试结果应分开报告。已有 EEG 相关工作尚未检索确认。
值得核对其以张量收缩顺序优化训练、扩展 SSM 通道交互方式的实现,以及异构块相对同构块的性能与资源开销对照;对 EEG 的适用性尚未验证。
来源:OpenReview · State space models · openreview.net