结构化状态空间模型中的特征学习研究
On Feature Learning in Structured State Space Models
基于摘要分析。本文研究状态空间模型(SSMs)及 Mamba 等结构化变体在网络宽度趋于无穷时能否持续学习特征,核心贡献是通过前向与反向信号传播分析,识别支持非平凡特征演化的缩放条件。研究对象是通用序列模型的参数化与宽度缩放理论,并非 EEG 或 BCI 验证。 作者报告,已有 Maximal Update Parameterization 缩放规则不能在所研究的 SSM 中支持特征学习,并将这一问题关联到这些模型无法表示为 Tensor Programs 的形式;在其他架构中可支持特征学习的谱缩放条件,对 SSM 也不具有相同含义。需要结合全文核对这些结论所针对的模型类别、数学假设及适用边界,不能直接推广为所有 SSM 参数化均无效。 作者报告,提出的缩放方式表现出与 Maximal Update Parameterization 类似的性质,包括更好的稳定性、泛化,以及最优超参数从小规模 SSM 向大规模 SSM 的可迁移性。摘要未提供具体缩放公式、训练任务、数据集、模型规模、对照设置或数值结果;实验协议、消融及统计信息尚未验证,尚不能判断这些性质在何种有限宽度与训练条件下成立。 平台推测(待验证):若采用 SSM 处理 EEG 序列,本文机制可能用于检验增大模型宽度时特征是否仍能有效更新,以及小模型调参能否减少大模型搜索成本。这一假设依赖全文缩放规则可落实到具体 EEG 架构;可复用的是参数化与宽度缩放原则,输入编码、通道组织和任务输出仍需按 EEG 数据改造。低信噪比、跨被试差异及小数据条件可能使理论上的特征演化无法转化为泛化收益。一个可检验的小实验是在固定 EEG 任务与跨被试划分下,对比默认参数化与论文缩放方式,保持训练预算和输入处理一致,检查不同宽度的训练稳定性、特征变化及小模型超参数迁移后的任务表现。已有 EEG 相关工作尚未检索确认。
值得阅读其基于前向与反向信号传播推导的 SSM 宽度缩放条件,以核对常用参数化规则的适用边界及小模型超参数向大模型迁移的依据;其 EEG/BCI 价值尚未验证。
来源:OpenReview · State space models · openreview.net