状态空间模型的表达能力:形式语言视角
The Expressive Capacity of State Space Models: A Formal Language Perspective
基于摘要分析。本文研究用于语言建模的线性状态空间模型(SSMs)原则上能够表示哪些序列计算,并从形式语言视角比较其与 transformers、传统 RNN 的能力。核心贡献是揭示不同架构具有相互重叠但并不相同的表达优势,而非仅依据语言建模表现判断架构能力。 作者报告,在 star-free 状态跟踪问题中,SSMs 可以实现直接且精确的解,而 transformers 难以精确表示这些解;SSMs 还能够以最优内存建模有界层级结构,无需模拟栈。另一方面,作者识别出现有 SSMs 中一项限制表达能力的设计选择,并讨论其对 SSM 与语言建模研究的影响。摘要未说明该设计选择的具体内容,也未给出理论成立所依赖的精度、状态维度或输入长度等条件,需查阅全文核对。 作者报告在 Mamba 上进行了经验验证,但摘要未提供具体任务、数据构造、训练设置、对照结果或指标,因此不能据此判断实际性能提升,也不能将形式表达能力直接等同于可训练性或泛化能力。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其状态跟踪视角可能为 EEG 中有限状态事件序列的建模提供分析工具,但原研究对象是语言模型及形式语言,不是 EEG 或 BCI。迁移假设依赖任务具有可定义的离散状态及可靠监督;可复用的是状态跟踪的理论分析框架,需改造的是连续 EEG 到状态事件的输入表示与任务定义。低信噪比、跨被试差异、通道变化和小数据条件可能使理想化状态跟踪优势无法体现。一个可证伪的小实验是:在同一被试内划分下,为预先定义的有限状态事件序列构造带可控噪声的 EEG 模拟输入,比较 Mamba、transformer 与传统 RNN 的状态预测错误率随序列长度和噪声变化的趋势;该实验仅检验迁移假设,不构成真实 BCI 有效性的证据。已有 EEG 相关工作尚未检索确认。
值得阅读其对 SSM、transformers 与传统 RNN 表达能力的理论比较,尤其是精确状态跟踪的优势及架构设计带来的限制;这些结论对 EEG 序列建模的适用性尚未验证。
来源:OpenReview · State space models · openreview.net