跳到正文
OpenReview · State space models· Nicola Muca Cirone; Antonio Orvieto; Benjamin Walker; Cristopher Salvi; Terry J. Lyons·· 2024-01-01精选AI 评分81

深度选择性状态空间模型的理论基础

Theoretical Foundations of Deep Selective State-Space Models

AI 导读

基于摘要分析。本文研究深度选择性状态空间模型(SSMs)的表达能力,利用 Rough Path Theory(粗糙路径理论)为输入与隐藏状态之间的乘性交互及选择性机制建立理论分析框架。主要贡献是刻画广义选择性 SSMs 的表达能力,并将门控机制识别为关键架构选择;研究对象是通用序列模型,而非 EEG 或 BCI 系统。 核心机制是让驱动 SSM 的线性递推具有依赖输入的选择性,通过输入与隐藏状态的乘性交互改变序列信息的处理方式。作者报告,其框架给出了 Mamba 等现代 SSM 表达能力的闭式描述,并从理论上解释其相对 S4 等上一代模型的能力提升。摘要同时涉及 GLA、Hawk/Griffin、HGRN2,但各模型对应的具体定理、假设与适用边界尚未验证。作者进一步提出,跨通道交互可能是未来改进的重要方向;这不是已验证的 EEG 通道建模结果。 摘要将十亿参数规模文本模型中的准确性与效率优势作为研究背景,不能据此视为本文新增的实验结论,也不能外推为 EEG 解码优势。全文未取得,理论中的模型限制、深度与表达能力的关系、证明细节,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设选择性门控能够抑制无关时段并保留任务相关动态,它可能对应 EEG 长序列中有效信息稀疏、时序依赖复杂的瓶颈。可复用的是选择性递推机制;输入表示、采样尺度及跨电极交互需要针对 EEG 改造。其效果可能受低信噪比、伪迹驱动的错误门控、跨被试分布变化和小数据过拟合限制,理论表达能力提升并不保证泛化提升。一个可证伪的小实验是在固定 EEG 任务、数据划分、参数预算和训练流程下,对比选择性与非选择性 SSM,并单独控制跨通道交互,检验门控是否稳定改善预先指定的解码指标。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其对选择性与门控机制表达能力的理论刻画,以区分现代 SSM 相对 S4 的机制变化与经验性能结论,但其对 EEG 建模的价值尚未验证。

来源:OpenReview · State space models · openreview.net