多模型反馈循环中的模型坍塌在权重空间中局部可逆
Model Collapse in Multi-Model Feedback Loops Is Locally Reversible in Weight Space
基于摘要分析。本文研究多个语言模型家族共同生成并使用合成文本训练时的模型坍塌,核心贡献是通过相邻检查点的权重差进行反向外推,检验坍塌轨迹在参数空间中的局部可逆性;研究对象是语言模型,而非 EEG 或 BCI。 每轮反馈中,不同语言模型家族生成合成文本,将输出汇集并打乱后,各模型在共享语料上训练。作者报告,在 1B–1.5B 参数模型的全参数训练循环和 7B–8B 参数模型的 QLoRA 训练循环中,多模型参与仍会发生模型坍塌,说明该设置下生成来源多样化并未阻止退化。 恢复方法取当前检查点 θ_i 与进一步坍塌一步的检查点 θ_{i+1},构造 θ̂_{i−1}=θ_i−α(θ_{i+1}−θ_i),并与当前检查点及更早的目标检查点 θ_{i−1} 比较。作者报告,这种 task-vector negation 无需外部数据,便能降低各模型家族在留出语料上的困惑度,并显著缩小与目标检查点的下游表现差距;摘要未提供具体任务、差距数值或统计检验细节。 作者的轨迹分析显示,相邻坍塌步骤方向正向对齐但不共线,且步长范数随代际缩小。作者据此解释一步反向外推有效、两步外推退化,以及较大反向系数恢复更好的现象。这支持将局部坍塌理解为权重空间的方向性漂移,但不能据此推断长期坍塌完全可逆。语料组成、评估划分、α 的选择方式、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型也存在连续合成数据反馈训练导致的退化,假设可复用相邻检查点差分来检验局部恢复,但需改造生成与训练流程,并控制被试、通道及任务的一致性。低信噪比、小数据和跨被试变化可能使权重差主要反映随机波动而非稳定退化方向。一个可证伪的小实验是固定 EEG 任务及独立真实测试集,比较当前检查点、一步反向外推与早期目标检查点;反向系数仅在验证集选择。该假设不构成已证实的 EEG 效果,相关已有工作尚未检索确认。
值得核对其无需外部数据的权重反向外推方法及适用边界:作者报告它能缓解多模型合成语料反馈训练中的退化,但证据支持的是局部恢复,而非完全逆转模型坍塌。
来源:OpenReview · State space models · openreview.net