层重要性揭示了 Transformers 与状态空间模型的哪些特征?
What Does Layer Importance Reveal About Transformers and State-Space Models?
基于摘要分析。该研究关注针对 Transformers 建立的分析认识能否迁移到状态空间模型(SSMs),通过区分层的 Necessity(必要性)与 Plasticity(可塑性),比较两类序列模型的层重要性及其与下游适应、灾难性遗忘的关系。 核心机制是将“重要”拆成两个不同问题:Necessity 衡量预训练模型对某层现有贡献的依赖,以绕过该层后的损失增量度量;Plasticity 衡量微调时新信息主要被哪些层吸收,以任务特定权重更新的幅度度量。这一区分避免将维持原有能力所需的层与最易发生任务适应的层直接等同,为压缩、选择性微调和可解释性分析提供共同视角。 作者报告,在所分析的残差 Transformers 中,两种重要性沿深度呈反向对齐,而在 Mamba-style SSMs 中,两者指向重叠区域。作者还报告,这种对齐关系的符号能够预测下游适应行为:Transformers 中更新集中于最具可塑性的层,与更强的灾难性遗忘相关;Mamba-style SSMs 中则未观察到同样的层级依赖效应。摘要未给出具体模型、任务、数据、权重更新的归一化方式或遗忘指标,实验协议、消融及统计信息尚未验证,不能据此认定某类架构普遍更适合持续学习。 平台推测(待验证):若 EEG 预训练序列模型也具有可区分的必要性与可塑性,该框架或可帮助分析跨被试、跨会话适应中哪些层保留通用表征、哪些层吸收新域信息。可复用的是逐层绕过与微调更新分析;需改造的是 EEG 任务损失、通道输入及更新幅度的可比性处理。低信噪比、小数据和通道差异可能使重要性估计不稳定。一个可检验的小实验是在固定跨被试划分和相同微调预算下,对 EEG Transformer 与 Mamba-style SSM 分别测量两种层重要性,并比较选择性微调后的目标被试表现与原域性能保持情况。该迁移是假设,不是论文已验证的 BCI 效果;已有 EEG 相关工作尚未检索确认。
该研究将层重要性拆分为预训练贡献的必要性与微调可塑性,为比较 Transformers 与 Mamba-style SSMs 的选择性微调和遗忘行为提供了可核对的分析框架,但具体实验协议与因果解释尚未验证。
来源:OpenReview · State space models · openreview.net