论结构化状态空间对偶
On Structured State-Space Duality
基于摘要分析。本文研究 Structured State-Space Duality(SSD)的适用范围,将标量乘单位状态矩阵的 SSM 与 masked attention 之间的既有等价关系推广到一般对角 SSM,并分析等价成立的条件及标准 softmax attention 下的边界。 原有 SSD 将状态矩阵为标量乘单位矩阵的 SSM,与采用 1-semiseparable 因果掩码的自注意力对应起来:同一个序列变换可由线性时间 O(T) 递归或二次时间 O(T²) attention 实现,其中 T 为序列长度;这些复杂度描述的是对应算法实现,不代表任意 SSM 或 attention 的通用复杂度。 作者报告,一般对角状态矩阵可支持更丰富的动态,同时达到标量情形相同的训练复杂度下界;作者还给出 SSM 等价于 1-semiseparable masked attention 的充要条件,并指出由于秩膨胀,这种对偶不能推广至标准 softmax attention。摘要未给出具体复杂度下界表达式、充要条件的数学形式或证明假设,这些仍需正文核对。上述贡献属于理论结论,不能据此推断任务精度、实际训练速度或硬件效率提升。摘要提供了代码地址,但实现内容及复现条件尚未验证。 平台推测(待验证):一般对角 SSM 的递归计算与更丰富状态动态,可能为长 EEG 序列建模提供候选模块;这一假设依赖 EEG 的时间顺序结构,并不意味着原文已验证 BCI 效果。可复用部分是状态更新及其等价计算形式,需另行设计多通道输入映射、监督目标和跨被试评估。低信噪比、通道差异与小样本可能使更丰富的动态难以稳定学习。一个可证伪的小实验是,在固定 EEG 数据划分、预处理及训练预算下比较标量与一般对角 SSM,分别记录任务指标、运行时间和内存,并验证等价实现的输出一致性。已有 EEG 相关工作尚未检索确认;本文实验协议、消融及统计信息尚未验证。
值得核对其一般对角 SSM 的复杂度结论与等价条件,这些理论结果有助于明确递归状态空间计算与 masked attention 可互换的范围,而非将该对偶泛化到标准 softmax attention。
来源:OpenReview · State space models · openreview.net