状态空间模型中的状态幻象
The Illusion of State in State-Space Models
基于摘要分析。本文研究面向 LLM 的状态空间模型(SSMs)是否比 transformer 更擅长表达序列计算与状态跟踪,核心贡献是从计算复杂度角度分析其表达能力,并以 Mamba-style SSM 的状态跟踪实验补充理论论证。研究对象是通用序列模型,而非 EEG 解码或 BCI 系统。 作者指出,SSM 虽然在架构上接近 RNN、具有递归形式,但这并不自动赋予其更强的状态跟踪能力。作者报告,在论文所分析的设定下,SSM 的表达能力被限制在复杂度类 TC⁰ 内,与 transformer 存在相似限制,并据此讨论排列复合等状态跟踪问题的不可表达性。摘要进一步将这一限制关联到特定记谱方式下的棋步跟踪、代码求值和长叙事中的实体跟踪。由于未取得全文,精度、序列长度、模型规模及计算假设等理论适用条件尚未验证,不宜将结论泛化为所有 SSM 在任意条件下都无法完成这些任务。 实验方面,作者报告 Mamba-style SSM 在状态跟踪任务上存在困难;摘要未提供具体数据集、训练设置、对照基线或量化结果。实验协议、消融及统计信息尚未验证,因此目前只能确认作者报告的定性结论,不能判断失败程度或与其他架构的性能差距。 平台推测(待验证):若某项 EEG/BCI 任务确实依赖离散状态的持续更新,而非主要依赖局部波形或频谱识别,本文可作为审视 SSM 架构选择的理论线索。但原文依赖的是抽象序列计算问题,不能直接推出低信噪比、跨被试或有限通道 EEG 上的效果;理论条件与实际解码任务的对应关系仍需评估,已有 EEG 相关工作尚未检索确认。
值得阅读之处在于作者将 SSM 的递归形式与状态跟踪表达能力区分开来,并以复杂度分析和 Mamba-style SSM 实验检验这一差异;理论结论的适用假设需结合全文核对。
来源:OpenReview · State space models · openreview.net