DepthSSD:通过深度轴上的状态空间模型重新思考残差连接
DepthSSD: Rethinking Residual Connections via State Space Models on the Depth Axis
基于摘要分析。本文研究深层 transformer 的层间信息流,提出 DEPTHSSD(Depth State Space Duality),将 Mamba-2 的结构化状态空间对偶框架应用于网络深度轴,以可控秩的深度混合连接探索标准残差与注意力式深度混合之间的表达能力和效率权衡;研究对象并非 EEG 或 BCI。 作者指出,transformer 的深度轴混合矩阵具有半可分结构,其秩控制层间信息流的表达能力:标准残差对应秩为 1 的半可分矩阵,注意力残差对应满秩矩阵。DEPTHSSD 使用可控秩 N,每个子层的参数复杂度为 O(L·N)。这里处理的是跨网络层的信息混合,不能直接等同于时间序列上的状态空间建模。具体矩阵构造、理论成立条件及训练实现尚需全文核对。 作者在 125M、455M 和 1B 参数规模上,与标准残差、BLOCKATTNRES、DENSEFORMER 及 Hyper-Connections 比较。作者报告:在 1B 规模下,DEPTHSSD-N=8 的验证损失为 3.124、perplexity(PPL)为 22.7,标准残差与 DENSEFORMER 的 PPL 分别为 25.1 和 24.1;相较 DENSEFORMER,报告的计算吞吐率为 16.5 对 9.6 TFLOPS,即 1.72 倍。在 455M 规模下,其 PPL 为 29.4,DENSEFORMER 与标准残差分别为 30.1 和 31.2,吞吐率为 DENSEFORMER 的 1.88 倍。在 125M 规模下,作者报告验证质量与各基线相当,相较其他深度混合方法吞吐率高 1.3–1.6 倍。训练数据、划分、硬件、计时口径、消融及统计信息尚未验证,不能据此认定普遍优势。 平台推测(待验证):若 EEG transformer 的瓶颈包含深层特征传播,可尝试复用深度混合模块,但需适配 EEG 表征与任务输出;该机制本身不直接解决低信噪比、通道差异或跨被试分布偏移。小数据条件下,增加混合自由度也可能导致过拟合。一个可检验的假设是:固定 EEG 数据、跨被试划分与训练预算,仅替换标准残差并改变 N,比较同一任务指标、运行成本及多次运行波动,检验收益是否超出额外容量带来的变化。已有 EEG 相关工作尚未检索确认。
值得核对其以半可分矩阵秩统一残差连接与注意力式深度混合的理论,以及同规模模型下验证质量与计算吞吐率的权衡;其 EEG/BCI 适用性尚未验证。
来源:OpenReview · State space models · openreview.net