VisualErase:通过双分支视觉轨迹重定向实现文本到图像扩散模型的稳健概念擦除
VisualErase: Dual-Branch Visual Trajectory Redirection for Robust Concept Erasure in Text-to-Image Diffusion Models
基于摘要分析。VisualErase 针对文本到图像扩散模型中“文本映射已被重定向,但目标概念的视觉生成轨迹仍可能被攻击恢复”的问题,提出以明确的概念移除图像为终点,重定向携带目标概念的视觉生成轨迹,同时约束文本条件与无条件去噪预测。 核心机制是先用保留结构的图像编辑,为源图像构建内容对齐、移除目标概念的对应图像,使非目标内容尽量保留;再根据源图像与对应图像的配对关系推导去噪目标。双分支重定向损失使文本条件预测和无条件预测都对齐这一目标,针对仅有条件监督无法显式约束无文本引导生成的问题。为降低擦除对非目标生成的影响,方法同时优化对应图像保留损失,使相关去噪预测匹配冻结预训练模型的预测。其具体损失公式、配对图像生成流程和训练配置尚未验证。 作者报告,在风格、名人和裸露内容擦除任务中,七种攻击下的最大攻击成功率分别为 0%、8% 和 0.1%,并称保留了通用生成质量。这些数值仅对应摘要所述攻击集合与任务,不能解释为对任意攻击均有效;攻击名称、样本规模、成功判定标准、基线设置及生成质量指标尚未验证,实验协议、消融及统计信息尚未验证。 阅读重点是区分文本条件映射改变与视觉生成轨迹改变的证据,并核对无条件分支、配对编辑质量和保留损失各自的贡献。该方法依赖文本到图像扩散模型及概念移除的配对视觉监督,摘要未提供 EEG/BCI 验证,不能直接推断其对脑信号模型的遗忘或隐私保护有效;相关 EEG 工作尚未检索确认。
值得核对其双分支视觉轨迹重定向能否在不同攻击协议下提高概念擦除的稳健性,以及配对图像编辑和保留损失对非目标生成能力的影响。
来源:arXiv · 多模态与生成机制 · arxiv.org