跳到正文
arXiv · 多模态与生成机制· Nikhil Verma; Siddharthan Dileep; Anoop Singh; Srikanth Sastry; Ramya Hebbalaguppe; Sayan Ranu; N. M. Anoop Krishnan·· 1 天前精选AI 评分85

通过盆地几何与循环去噪识别扩散模型记忆的早期信号

Early Signatures of Memorization in Diffusion Models via Basin Geometry and Cyclic Denoising

AI 导读

基于摘要分析。本文研究扩散模型在单次生成尚未出现训练样本近似复制时,是否已形成可检测的记忆结构。作者提出“潜在记忆”(latent memorization),以 score divergence 和盆地体积刻画训练样本附近的局部吸引域,并用循环去噪探测其稳定性。 核心机制是反复执行部分加噪与去噪,而非仅检查单次生成输出。作者报告,训练样本附近的局部盆地在首个记忆样本出现前已形成,并可与留出样本区分;其出现时间与记忆发生时间具有相同的 O(n) 标度,但摘要未明确 n 的定义与适用条件。在精确经验 score 的假设下,作者证明:从孤立训练样本附近启动的循环过程,会以高概率恢复该样本,并在任意有限次数的循环中返回该样本。该理论前提不能直接等同于有限训练模型的保证。 作者报告,在 CelebA 和 CIFAR-10 的已训练检查点上,即使单次生成样本中未观察到复制,循环去噪仍能恢复训练图像;在一个单次生成复制比例为 0.1% 的 CelebA 检查点上,500 次循环使记忆样本比例超过 30%。这些比例对应不同采样过程,不应视为相同协议下的直接性能比较。作者还报告,循环会揭示不匹配任何单个训练图像的退化吸引子,且这些吸引子随训练推进而消退,因此停留在盆地中本身不足以判定记忆。 摘要称相关发现覆盖 Gaussian mixture、CelebA 和 CIFAR-10,并涉及不同优化器、架构、噪声调度与训练集规模。在现成的 Stable Diffusion v1.4 上,作者报告,循环后的条件—无条件 divergence gap 区分记忆与非记忆提示词的 AUC 为 0.944,在 FPR 为 1% 时 TPR 为 0.866;提示词构成、记忆标签与阈值选择尚未验证。 复现需核对近似复制判据、循环起点、加噪强度、score divergence 与盆地体积的估计方法,以及留出划分、采样预算和统计不确定性。实验协议、消融及统计信息尚未验证。平台推测(待验证):该审计思路可能用于 EEG 生成模型的训练样本记忆检查,但图像空间中的盆地结构与判据能否适用于低信噪比、跨被试 EEG 尚不明确;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其将盆地几何与循环去噪用于提前审计扩散模型记忆的机制,尤其是区分训练样本吸引域与非样本退化吸引子的证据;检测协议与复现条件尚需全文核对。

来源:arXiv · 多模态与生成机制 · arxiv.org