跳到正文
arXiv · 多模态与生成机制· Kaiyuan Deng; Yuchen Li; Yang Xiao; Bo Hui; Geng Yuan; Xiaolong Ma·· 5 天前精选AI 评分79

你的遗忘暴露了你:识别扩散模型中被移除的概念

Your Unlearning Gives You Away: Identifying Erased Concepts in Diffusion Models

AI 导读

基于摘要分析。本文研究扩散模型经过概念遗忘后,攻击者如何在不知道移除目标的情况下识别被移除的概念,并估计其总数。作者提出 Tracer,通过权重足迹的轻量级谱分析搜索候选概念,而不依赖生成图像后再分类。 核心机制是利用遗忘在模型权重中留下的足迹,在大规模候选词汇表中定位相关概念。针对多个被移除概念,作者引入 footprint coverage objective,引导顺序发现;当已选概念能够解释遗忘足迹时,通过候选置信度的显著下降估计概念数量,无需带标签的校准样本。摘要称该框架仅需轻量级线性代数运算和有限的前向探测,且不要求预先知道遗忘算法。权重足迹的具体定义、是否必须同时访问原始与遗忘后模型、候选词汇表的构建方式及置信度计算尚未验证。 作者报告,在文本生成图像与文本生成视频骨干以及多种遗忘方法上,Tracer 可在数秒内识别被移除概念并估计数量。以 MIA 和暴力搜索为对照,作者报告图像模型上的加速范围为 150–137,000 倍,视频模型上为 133–20,000 倍,并称识别准确率显著更高。摘要未给出各倍率对应的具体模型、对照方法、硬件、候选规模或准确率数值,因此不能将这些范围视为统一实验协议下的性能结论。 该工作的主要研究对象是生成模型概念遗忘后的信息暴露,而非 EEG 解码或 BCI。其可核对价值在于评估隐藏遗忘目标能否构成有效保护,以及权重变化是否仍泄露目标身份。需进一步核对候选集合覆盖范围、多概念之间的关联、不同遗忘强度下的计数可靠性及访问权限限制;实验协议、消融及统计信息尚未验证。现有材料未提供明确的 EEG/BCI 机制对应关系,不据此提出迁移效果或复现实验建议。

阅读价值

值得阅读的具体原因是 Tracer 将扩散模型遗忘攻击从恢复已知概念推进到识别未知被移除概念及其数量,并提出无需生成图像的权重足迹分析路径;其效率优势与访问条件仍需结合全文核对。

来源:arXiv · 多模态与生成机制 · arxiv.org