状态空间模型中状态的幻象
The Illusion of State in State-Space Models
基于摘要分析。本文研究面向 LLM 的状态空间模型(SSMs)是否比 transformer 更擅长表达顺序计算与状态跟踪;核心贡献是给出表达能力的复杂性分析,并以 Mamba-style SSMs 的状态跟踪实验作为补充。原论文的主要对象是语言模型架构及离散状态跟踪任务,并非 EEG 或 BCI。 SSMs 的递归形式与 RNNs 相近,容易让人将其内部状态理解为能够支持一般性的状态更新。作者的分析指出,所研究 SSMs 的表达能力仍受复杂性类 TC^0 限制,与 transformer 存在相似边界。作者据此认为,这类模型无法表达置换复合等状态跟踪计算,并将结论联系到特定记谱方式下的国际象棋走子跟踪、代码求值及长篇叙事中的实体跟踪。摘要未交代模型定义、精度、深度及序列长度等定理条件,不能将这一结论无条件推广到所有 SSM 变体或所有有限长度任务。 作者报告,Mamba-style SSMs 在状态跟踪实验中表现困难;摘要未提供数据集、划分、对照基线或量化指标,因此尚不能评估理论边界与实际误差之间的对应程度。实验协议、消融及统计信息尚未验证。 平台推测(待验证):该理论视角可用于审视 EEG 序列模型是否真正保留了任务所需的历史状态,但离散置换复合与连续、低信噪比 EEG 建模之间的对应关系尚未建立,不能据此判断 SSM 在 EEG 解码中的优劣。已有 EEG 相关工作尚未检索确认。
该研究通过计算复杂性分析检验 SSM 的递归形式是否带来更强的状态跟踪能力,值得用于审视架构能力边界,但具体定理假设与实验适用范围仍需全文核对。
来源:OpenReview · State space models · openreview.net