Mamba 状态空间模型是 Lyapunov 稳定的学习器
MAMBA STATE-SPACE MODELS ARE LYAPUNOV-STABLE LEARNERS
基于摘要分析。本文研究 Mamba 状态空间模型(SSMs)能否稳定、有效地使用混合精度微调(MPFT)与参数高效微调(PEFT),主要对象是大语言模型及自然语言任务。核心贡献是利用 Lyapunov 指数分析递归动力学对小输入变化的稳定性,并提出针对 Mamba 定制 CUDA 内核中特定内存缓冲区的低秩适应方式。 机制方面,作者将混合精度引入的变化作为稳定性问题,通过动力系统理论给出肯定结论。作者报告,在摘要所述的多项实验中,Mamba 对混合精度变化比可比 Transformer 更稳定,且这一现象在联合使用 MPFT 与 PEFT 时仍成立。摘要未提供稳定性成立的具体假设、指数计算方式或扰动范围,因此不宜将其扩展为对任意噪声与分布变化的鲁棒性保证。对于 PEFT,作者称针对特定内存缓冲区的低秩适应能够正则化 SSM 参数,并兼顾参数效率与计算节省;实现细节和节省幅度尚未验证。 结果方面,在自然语言任务的 in-context learning(ICL)评估中,作者报告:预训练 Mamba 与 Mamba-2 的 ICL 改善幅度分别达到可比 Transformer 的 38% 与 82%;联合启用 MPFT、PEFT 并进行指令微调后,相应比例为 81% 与 132%。这些数字是相对于 Transformer 的改善幅度比例,不是 Accuracy,也不是百分点增益。具体任务、模型规模、对照匹配、数据划分、改善幅度定义,以及消融与统计信息尚未验证。 平台推测(待验证):可迁移的假设是,该稳定性分析与微调实现可能帮助评估 EEG 序列模型在低精度部署或小数据微调时的数值可靠性。可复用部分是扰动分析和低秩适应思路;输入编码、任务监督及内核适配需要重新设计。EEG 的低信噪比、跨被试差异和通道变化不等同于混合精度扰动,数值稳定也不保证解码性能。一个可检验的小实验是在固定 EEG 被试内划分下,对同一 Mamba 模型比较全精度与混合精度微调的输出偏差和任务指标,再检查加入 PEFT 后的变化。已有 EEG 相关工作尚未检索确认。
值得核对其以 Lyapunov 指数分析 Mamba 递归动力学对混合精度扰动的稳定性,以及面向定制 CUDA 内核的低秩适应实现;这些结论针对语言模型,尚不能视为 EEG/BCI 有效性的证据。
来源:OpenReview · State space models · openreview.net