跳到正文
OpenReview · State space models· Nicola Muca Cirone; Antonio Orvieto; Benjamin Walker; Cristopher Salvi; Terry J. Lyons·· 2024-01-01精选AI 评分80

深度选择性状态空间模型的理论基础

Theoretical Foundations of Deep Selective State-Space Models

AI 导读

基于摘要分析。本文研究深度选择性状态空间模型(SSM)的表达能力,核心贡献是借助 Rough Path Theory,为输入与隐藏状态之间具有乘性交互的线性递推提供理论解释,而非提出或验证 EEG/BCI 专用模型。 核心机制:作者报告,当随机线性递推配备简单的输入控制状态转移,即选择性机制时,其隐藏状态可被证明是输入 signature 的低维投影。signature 是刻画路径信息的数学对象;摘要强调,该联系能够解释模型如何捕获不同时刻、不同时间尺度上输入 token 之间的非线性交互。论文据此为 Mamba 等选择性 SSM 的表达能力提供解释,并为分析未来 SSM 变体提供框架。具体定理假设、投影与近似条件、输入路径要求及误差界尚未验证。 创新与证据边界:摘要以 S4 为结构化 SSM 背景,并列举 GateLoop、Mamba、GLA 作为具有相关乘性交互机制的例子。摘要提到此类架构在十亿参数规模文本模型中的准确性与效率优势,但未给出本论文对应的实验协议或数值,不能将这一背景陈述视为本文完成的性能验证。实验协议、消融及统计信息尚未验证。 平台推测(待验证):假设输入控制的状态转移能够根据 EEG 时序内容调节信息保留,它可能为长时依赖与多时间尺度动态建模提供机制参考;原领域理论成立不等于 BCI 有效。可复用的是选择性递推及其表达能力分析视角,需改造的是连续多通道 EEG 的输入编码、采样尺度与状态读出。低信噪比可能使选择性机制响应伪迹,跨被试分布差异、通道配置变化及小数据训练也可能限制收益。一个可检验的小实验是在固定 EEG 任务、被试内划分和匹配训练预算下,比较输入控制递推与固定转移递推,并测试加入噪声后收益是否保持。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读之处是作者用 Rough Path Theory 将输入控制的状态转移与输入 signature 的低维投影联系起来,为理解选择性 SSM 的表达能力提供理论框架,但其 EEG/BCI 适用性尚未验证。

来源:OpenReview · State space models · openreview.net