跳到正文
arXiv · 多模态与生成机制· Yuchen Li; Kaiyuan Deng; Chaoran Feng; Zhenyu Tang; Li Yuan·· 7 天前精选AI 评分80

FADE:基于帧感知 Diffusion Transformer 的多概念擦除与视频遗忘

FADE: Frame-Aware Diffusion-Transformer-based Multi-Concept Erasure for Video Unlearning

AI 导读

基于摘要分析。该研究针对 Text-to-video(T2V)扩散模型的概念擦除问题,提出 Frame-Aware Diffusion Erasure(FADE),旨在同时移除多个指定概念并保留非目标生成行为。其关注的关键问题是:忽略帧差异的抑制可能让已擦除概念在个别帧中重新出现,而视频片段级平均指标可能掩盖这种残留。 机制上,FADE 先对 key/value 执行联合闭式编辑以抑制全部目标概念,再训练各概念专属的帧感知低秩适配器,通过帧索引与去噪时间步控制适配强度,清除逐帧残留。训练每个适配器时,将其他目标概念的提示词作为困难负例,以分离不同适配器的概念特异性成分;推理时由基于相似度的软路由器根据提示词组合适配器。具体编辑公式、损失、路由相似度定义及训练成本尚未验证。 作者报告,在单个 Wan2.1-T2V-1.3B 骨干上同时擦除涵盖物体、艺术风格与裸露内容的 16 个概念后,物体基准的残留 Accuracy 为 4.9%,八种基线中最强者为 15.5%;VBench 平均值与未编辑模型的差异保持在 0.9% 以内。这里的残留 Accuracy 用于衡量擦除后目标概念的残留,不能视为一般任务分类性能;摘要未说明 VBench 差异的具体计算口径。作者还报告,VLM 评判与盲法人类研究下方法排名不变,相对最强基线的优势延续至多目标组合提示词、同时擦除 30 个名人身份,以及 Wan2.1-T2V-14B、CogVideoX-2B 和 HunyuanVideo-1.5。 复现时应重点核对逐帧与片段级指标的关系、目标及非目标提示词划分、残留判定阈值、基线配置,以及闭式编辑、帧感知门控、困难负例和软路由各自的贡献。实验协议、消融及统计信息尚未验证。该研究的直接证据限于视频生成模型遗忘,不能据此推导 EEG/BCI 中的身份信息去除或隐私保护效果;相关 EEG 工作尚未检索确认。

阅读价值

值得核对其逐帧概念再激活评估与多概念适配器隔离机制:作者报告在同一视频生成骨干上兼顾概念擦除和非目标生成质量,但具体评估协议与统计可靠性尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org