深层选择性状态空间模型的 token 动力学解析
Demystifying the Token Dynamics of Deep Selective State Space Models
基于摘要分析。本文研究预训练 Mamba 中 token 的动力学性质,试图解释深层选择性状态空间模型的内部演化及其对性能的影响。作者推导 Mamba 连续时间极限对应的动力系统,分析其解的渐近行为,并据此提出排除收敛情形、按重要性分数重排 token 两项改进。 理论方面,作者在一维情形下证明,所有 token 或全部收敛至零,或全部发散至无穷,并给出基于模型参数的判别条件。该结论不能直接扩展为任意维度、有限深度或实际离散 Mamba 的普遍行为。对于收敛情形,作者报告实证结果显示其会损害模型性能;对于发散情形,作者证明不同 token 的发散速率不同,并将其联系到训练更新中贡献不均的问题。 作者报告实验支持上述两项改进,但摘要未提供任务、数据集、预训练模型规模、重要性分数定义、对照基线或具体指标。连续时间近似与离散模型之间的对应条件、参数约束的实现方式、重排发生的位置,以及实验协议、消融及统计信息尚未验证。 平台推测(待验证):其可迁移价值主要是为 EEG 序列模型提供隐表示退化与 token 贡献不均的诊断思路,而非已经验证的 BCI 算法。迁移假设依赖 EEG 表征中的 token 动力学确实呈现类似现象;动力学监测思路可复用,但参数判据需核对高维适用性,重要性估计与重排需适配时间和通道结构。低信噪比可能使重要性分数偏向伪迹,跨被试差异和小数据可能使分数不稳定,重排还可能破坏时序信息。一个可检验的小实验是在固定跨被试划分的 EEG 任务中,对比原始 Mamba 与排除收敛情形的版本,同时记录隐表示范数和任务指标,检验范数衰减是否与性能下降一致;重排应另设对照。已有相关 EEG 工作尚未检索确认。
值得阅读的是其将 Mamba 的 token 渐近动力学与性能退化、训练贡献不均联系起来,并提出参数约束与 token 重排改进;理论适用范围及 EEG 迁移效果仍需验证。
来源:OpenReview · State space models · openreview.net