深层选择性状态空间模型的 token 动力学解析
Demystifying the Token Dynamics of Deep Selective State Space Models
基于摘要分析。本文研究预训练 Mamba 中 token 的动力学性质,旨在解释深层选择性状态空间模型(SSM)的行为,并据此提出改善实际性能的模型调整。其主要研究对象是通用序列模型,并非 EEG 或 BCI。 理论机制:作者推导了 Mamba 连续时间极限所对应的动力系统,并分析其解的渐近行为。在一维情形下,作者证明只会出现两种情况:所有 token 收敛到零,或所有 token 发散至无穷,并给出依据模型参数区分两种情况的判据。该结论受一维设定及连续时间极限分析前提约束,不能直接推广为任意维度、有限深度 Mamba 的普遍行为。 模型改进与证据:作者报告,经验验证显示收敛情形会损害模型性能;对于发散情形,作者证明不同 token 的发散速率不同,从而对训练更新产生不等贡献。基于这些分析,作者提出排除收敛情形,以及按照重要性分数重新排列 token 两项改进,并报告实验支持其有效性。摘要未提供重要性分数的定义、具体实现、任务、数据集、对照基线或量化指标;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若将 Mamba 用于 EEG 序列建模,token 动力学可能为检查表征衰减和训练贡献失衡提供分析工具,但原领域结论不等于 BCI 有效性。可复用的是动力学诊断思路和参数判据;需核对 EEG token 的时间或通道含义,以及重排是否破坏时序关系。低信噪比、跨被试差异和小数据条件可能使重要性分数不稳定。一个可检验的小实验是在固定 EEG 任务、划分和 Mamba 基线下,分别评估两项调整,记录 token 表征幅度、训练贡献及任务指标,检验动力学变化是否伴随性能改善;具体实现须先核对全文。已有 EEG 相关工作尚未检索确认。
值得阅读之处在于将 Mamba 的 token 动力学与参数条件、训练更新贡献及模型改进联系起来,但一维渐近结论的适用边界和改进效果仍需结合全文核对。
来源:OpenReview · State space models · openreview.net