选择性状态空间模型在正则语言上的表达能力与长度泛化
On the Expressiveness and Length Generalization of Selective State Space Models on Regular Languages
基于摘要分析。本文研究选择性状态空间模型(SSM)在正则语言任务中的表达能力与长度泛化,具体以有限状态自动机(FSA)模拟为研究对象,并提出 Selective Dense State-Space Model(SD-SSM)。研究关注模型能否表达不同类型的状态转移,以及在训练所覆盖的长度之外保持任务表现,而非直接研究 EEG 或 BCI。 核心机制是构建稠密状态转移矩阵字典,在每个时间步通过 softmax 选择机制形成字典矩阵的凸组合;读出模块由层归一化与线性映射组成。作者还评估了对角选择性 SSM 变体在可交换与不可交换自动机上的经验表现,并以理论考量解释实验结果。这一设计为分析状态转移结构如何影响序列模型能力提供了具体切入点,但摘要未给出理论命题及其成立条件。 作者报告,单层 SD-SSM 在所测试的一组正则语言任务上实现了完美长度泛化,并将其称为首个具备这一表现的选择性 SSM。该结论应限定于作者测试的任务与协议,不能扩展为任意正则语言或任意序列长度的保证。任务集合、训练与测试长度、数据规模、指标定义、对照配置、实验协议、消融及统计信息尚未验证。 平台推测(待验证):可检验的迁移假设是,稠密转移矩阵的选择机制可能更适合表达 EEG 中顺序敏感的时序状态变化。原任务具有离散符号与明确的自动机状态结构,而 EEG 是连续、低信噪比且存在被试与通道差异的信号,不能直接沿用其任务结论。可复用状态转移字典与选择机制,但输入编码、监督目标及读出需适配 EEG;小数据下的矩阵学习与选择稳定性也可能成为失败因素。一个小规模检验是,在固定输入编码、参数预算与训练条件下,对比稠密和对角选择性 SSM 在同一 EEG 时序任务上的表现,使用被试隔离划分,并单独考察训练外序列长度,避免混同跨被试泛化与长度泛化。已有 EEG 相关工作尚未检索确认,代码与完整复现条件尚未验证。
值得阅读的是其以有限状态自动机任务检验选择性 SSM 的表达能力与长度泛化,并用稠密状态转移和对角状态转移的差异连接实验与理论;这些结论对 EEG 序列建模的适用性尚未验证。
来源:OpenReview · State space models · openreview.net