跳到正文
arXiv · 多模态与生成机制· Haipeng Liu; Yang Wang; Meng Wang·· 4 天前精选AI 评分71

在频率感知扩散模型中解耦双图像参考以实现个性化生成

Disentangling Dual Image References in Frequency Aware Diffusion Models for Personalized Generation

AI 导读

基于摘要分析。本文研究以文本和双参考图像为条件的个性化图像生成,提出 Dual-FDM,通过频域掩码解耦参考图像中的不同频带,同时处理 customization style transfer 与 color style transfer。其主要研究对象是图像定制、颜色与风格迁移,而非神经信号建模。 作者将既有扩散模型在图像定制时的背景文本不对齐、以及风格迁移时的前景文本不对齐,归因于去噪过程中的混合频带纠缠。对于 customization style transfer,方法用定制参考图像前景的中频成分,替换风格参考图像背景的中频成分;对于 color style transfer,则用颜色参考图像前景与背景的低频成分,替换风格参考图像背景的低频成分。替换后的频带作为 key 和 value,用于重建去噪个性化图像前景与背景的 query。具体掩码构造、频带边界、训练方式及损失尚未验证。 作者报告,广泛实验表明 Dual-FDM 优于现有先进个性化图像生成扩散模型,但摘要未提供评估数据集、划分、对照模型、指标或数值,不能据此量化改进幅度。实验协议、消融及统计信息尚未验证。摘要提供了代码地址,但实现可用性、依赖、权重与复现条件尚未核对。 材料未提供 EEG/BCI 实验或具体应用对应关系;图像空间频率中的前景、背景与风格语义不能直接等同于 EEG 时间频段的功能含义,因此不将该结果视为 BCI 有效性的证据。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其利用频域掩码与频带替换分离双参考图像条件的机制,但作者报告的性能优势及其对 EEG/BCI 的适用性尚未验证。

来源:arXiv · 多模态与生成机制 · arxiv.org