跳到正文
OpenReview · State space models· Mugunthan Shandirasegaran; Hongkang Li; Songyang Zhang; Meng Wang; Shuai Zhang·· 2026-01-26精选AI 评分78

Mamba 训练动力学的理论分析:通过筛选相关特征实现状态空间模型的泛化

A Theoretical Analysis of Mamba’s Training Dynamics: Filtering Relevant Features for Generalization in State Space Models

AI 导读

基于摘要分析。该研究针对 Mamba 等选择性状态空间模型(SSMs)的学习动力学与泛化机制,分析输入依赖门控如何筛选类别相关特征,并在结构化序列数据假设下建立样本复杂度与收敛速率界;主要研究对象是通用序列模型,而非 EEG 或 BCI。 理论对象为一个简化的 Mamba 模块:单层、单头、带输入依赖门控的选择性 SSM,后接通过梯度下降(GD)训练的两层 MLP。数据模型中的 token 同时包含类别相关与类别无关模式,并受到 token 级噪声影响;分析覆盖 majority-voting 与 locality-structured 两类序列情形。具体损失函数、参数化方式及假设条件尚未验证。 作者报告,在上述结构化数据模型下可证明泛化保证,并给出非渐近样本复杂度和收敛速率界,且有效信号增强、噪声降低时这些界会改善。作者还报告,门控向量会与类别相关特征对齐并忽略无关特征,体现出类似注意力的特征选择作用,但通过选择性递归实现。这是机制层面的类比,不等于证明其优于 Transformer。作者报告合成数据数值实验支持理论结果;实验规模、噪声设置、对照、指标、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 序列能被表示为包含任务相关与无关模式的 token,该门控机制可能对应噪声与无关时段抑制问题;可复用选择性递归模块,但需改造 EEG 的时空 token 表示,并检验理论所依赖的结构化类别信号是否成立。低信噪比、跨被试分布差异、通道变化及小样本可能破坏相关特征对齐。一个可证伪的小实验是,在固定被试内划分与训练规模下,逐步注入无关时段和噪声,对比输入依赖门控与固定门控模型的分类表现及门控对相关时段的响应。该实验仅是迁移假设,已有 EEG 相关工作尚未检索确认;复现仍需核对全文中的理论条件与实现细节。

阅读价值

该研究以简化 Mamba 的门控特征选择机制连接训练动力学与泛化界,值得核对其结构化数据假设及理论适用范围,但尚不能据此认定对 EEG 或 BCI 有效。

来源:OpenReview · State space models · openreview.net