有害 SFT 在 LLM 检查点更新中留下连续痕迹
Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates
基于摘要分析。该研究考察监督微调(SFT)优化的目标行为能否直接从 LLM 检查点更新中读取,而不必运行模型进行行为测试。作者提出 TRACE,通过未知检查点更新相对于有害与非有害参考原型的位置,输出连续的有害目标分数,无需查询待审计模型或访问其未知 SFT 数据。 核心机制是以纯有害服从、安全目标和良性效用 SFT 定义参考几何,分析检查点更新空间中的目标相关排序。作者报告,在四个 7–8B 主干模型的受控有害目标组成实验中,检查点级坐标 s_H 与目标组成的 Spearman 相关系数为 0.986–0.992,并报告该排序在更大模型规模上仍然存在;摘要未提供这些更大模型的具体规模及对应数值。 对照方面,作者报告,匹配的服从与拒绝训练对照支持该痕迹反映 SFT 目标,而非仅反映接触有害输入;其他对照用于排除有害样本数量或一般训练强度的简单解释。作者还报告,在分布偏移、未见数据、不同 SFT 配置、部分检查点访问以及 LoRA/全参数微调条件下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;低有害目标比例下也仍具有信息量。各条件的具体划分、对照基线、分数及不确定性尚未验证,不能据此量化部署可靠性。 阅读与复现需重点核对参考原型的构建和冻结方式、未知更新与参考更新的兼容条件、部分权重访问的采样范围,以及审计分数与行为风险之间的校准关系。摘要提供代码地址,但代码内容与可运行性尚未验证;实验协议、消融及统计信息尚未验证。该工作研究的是 LLM 权重审计,并非 EEG/BCI 方法;其结果不构成已验证的 BCI 迁移证据。
值得核对其目标匹配对照与参考几何构建:作者报告仅凭 checkpoint 更新即可识别有害服从 SFT 的目标组成,为行为评估不可用或覆盖不足时提供互补审计信号,但参考原型依赖及跨设置可靠性尚需全文验证。
来源:arXiv · 泛化与分布偏移 · arxiv.org