跳到正文
10月8日周四
  1. arXiv · 在线与高效推理74

    适应位置的重要性:面向能力保留的层选择性微调

    基于摘要分析。研究关注 LLM 的参数高效微调(PEFT)在适应专门任务时可能损害预训练通用能力的问题,提出 Layer-Selective LoRA(LS-LoRA):以各 Transformer 层的输入—输出余弦相似度筛选适应位置,仅在低相似度层部署可训练 LoRA 适配器。 核心机制是将“在哪里适应”作为优化对象,而不是主要依赖数据回放或显式正则化约束。作者用逐层经验 Fisher 信息衡量目标任务敏感性,但其计算需要反向传播;因此提出仅需前向计算的输入—输出余弦相似度作为层敏感性排序的轻量代理。作者报告,在所评估的模型与任务中,较低的输入—输出相似度对应较高的经验 Fisher 分数。该观察支持选择低相似度层进行适应,但摘要未提供相似度聚合方式、层选择阈值及额外计算开销。 作者报告,在数学推理和代码生成实验中,相较标准全层 LoRA,LS-LoRA 提升了平均目标任务表现,并保留了更多常识推理能力。摘要未给出具体模型、数据集、指标数值、训练与评估划分,也未说明适配器参数预算是否匹配;实验协议、消融及统计信息尚未验证。需核对收益究竟来自层位置选择、可训练参数减少,还是两者共同作用,以及常识推理评估能代表多大范围的通用能力。 平台推测(待验证):若 EEG Transformer 的层输入—输出相似度也能反映下游任务敏感性,这种选择性适应可能用于检验跨被试或跨数据集微调时的能力保留。可复用模块是逐层前向相似度计算与 LoRA 层选择;需改造相似度在 EEG 时间片段和通道维度上的聚合方式,并依赖已有预训练编码器与下游监督数据。低信噪比、通道差异及小样本可能使层排序不稳定,LLM 中的代理关系不能直接视为 EEG 结论。一个可证伪的小实验是固定 EEG 编码器、跨被试划分与训练预算,对比低相似度层、高相似度层、随机层及全层 LoRA,同时核对相似度与经验 Fisher 排序的一致性,并评估目标任务及原任务保留情况。已有 EEG 相关工作尚未检索确认。

    阅读价值:值得核对输入—输出余弦相似度能否稳定替代逐层经验 Fisher 信息,以及选择性部署 LoRA 是否在可比训练条件下改善目标任务适应与通用能力保留的权衡。