状态空间模型中的状态幻象
基于摘要分析。本文研究面向 LLMs 的状态空间模型(SSMs)是否比 transformer 更擅长表达序列计算与状态追踪;核心贡献是通过形式化分析挑战这一假设,并以 Mamba-style SSMs 的状态追踪实验补充理论论证。 SSMs 的递归形式与 RNNs 接近,但递归形式本身不必然意味着更强的计算表达能力。作者报告,其分析所覆盖的 SSMs 的表达能力受复杂度类 TC⁰ 限制,与 transformer 存在相似的限制,因此不能表达超出该类的计算。作者据此指出,这些模型不能解决排列复合等状态追踪问题,并进一步讨论特定记谱方式下的棋步追踪、代码求值及长篇叙事中的实体追踪。摘要未给出定理涉及的精度、序列长度、模型规模或其他假设,不能将结论无条件推广到所有 SSM 变体。 作者报告,Mamba-style SSMs 在状态追踪实验中确实表现困难;摘要未提供任务构造、数据划分、对照基线或量化指标,实验协议、消融及统计信息尚未验证。需区分理论上的表达能力限制与具体训练条件下的性能困难,二者不能直接等同。 平台推测(待验证):若 EEG 任务确实依赖多步离散状态更新,而非主要依赖局部波形或统计特征,该分析可用于提出“递归结构是否足以支持所需状态追踪”的假设。可复用的是状态追踪测试思路,需改造的是 EEG 输入编码、状态定义及监督目标;低信噪比、跨被试差异、通道变化和小数据可能使输入表征或训练问题掩盖表达能力限制。一个可检验的小实验是在同一 EEG 数据划分中构造明确的多步状态更新目标,对比 Mamba-style SSM 与 transformer,并分别检查单步识别及随序列长度变化的状态追踪表现。此实验仅检验特定设置下的行为,不能直接验证复杂度定理;已有 EEG 相关工作尚未检索确认。
阅读价值:该文以计算复杂度分析和 Mamba-style SSMs 的实验检验,审视递归形式是否带来状态追踪表达能力优势,值得用于辨析架构中的“状态”与可实现的序列计算能力,但理论适用条件及 EEG 迁移价值尚未验证。