状态空间模型的参数高效微调
基于摘要分析。本文研究以 Mamba 为代表的深度状态空间模型(SSMs)如何进行参数高效微调(PEFT),重点比较既有 PEFT 方法的适用性及不同模块的微调价值,并提出 LoRA with Selective Dimension tuning(SDLoRA)。原论文的主要研究背景是语言建模,而非 EEG 或 BCI。 作者对四种基本 PEFT 方法进行了经验评估。作者报告,在所评估的 SSM 模型和实验条件下,基于提示的方法(如 prefix-tuning)不再有效,并提供了理论分析支持;LoRA 则仍然有效。进一步的理论与实验分析表明,在其考察的 LoRA 应用方式中,仅对线性投影矩阵应用 LoRA、而不修改 SSM 模块取得最佳结果,直接用 LoRA 微调 SSM 模块效果不佳。这里的结论针对 LoRA 的施加位置,并不意味着 SSM 模块不能通过其他方式调整。 SDLoRA 将两种调整方式结合:在线性投影矩阵上应用 LoRA,同时选择性更新 SSM 模块中的部分通道和状态。作者报告,该方法在所开展的实验中优于标准 LoRA。摘要未给出具体数据集、预训练模型规模、监督与数据划分设置、评价指标、增益幅度或可训练参数量;选择规则、理论成立条件、实验协议、消融及统计信息尚未验证,也无法据此判断性能与参数开销之间的权衡。 平台推测(待验证):若已有适用于 EEG 序列的预训练 SSM,该模块级微调策略可能用于检验小数据适配时应更新哪些参数。可复用的是线性投影的 LoRA 与 SSM 通道、状态的选择性更新思路;需改造的是 EEG 输入表征、任务输出及通道对应方式。该假设依赖可用的 EEG 预训练模型与下游监督数据,不能由语言建模结果直接推出。低信噪比、跨被试分布变化和通道配置差异可能使选择性更新不足以适配目标数据,也可能在小样本条件下过拟合。一个可证伪的小实验是在同一 EEG 预训练 SSM、固定 Cross-subject 划分和相近可训练参数预算下,比较线性投影 LoRA 与 SDLoRA 的下游表现及跨随机种子稳定性。已有 EEG 相关工作尚未检索确认。
阅读价值:该研究值得阅读的具体原因是,它区分了 SSM 模块与线性投影矩阵对参数高效微调的适配性,并提出可供核对与复现的 SDLoRA;其在 EEG/BCI 中的有效性尚未验证。