跳到正文
arXiv · 多模态与生成机制· Snigdha Chandan Khilar·· 5 天前精选AI 评分72

扩散模型何时决定画什么?

When Does a Diffusion Model Decide What to Draw ?

AI 导读

本研究考察扩散模型在去噪过程中何时从多种可能类别转向特定类别,并在 CIFAR-10 上用重复续采样测量这一“类别承诺”过程,同时评估较低成本的分类器代理测量。基于摘要分析;所提供摘要末尾截断,未取得论文全文。 核心测量方法是在生成中途固定一个尚未完成的图像状态,从该状态多次重新启动后续生成,统计最终输出属于各类别的频率;作者将相应概率称为 committor。这一测量关注给定中间状态的后续生成可能性,而不只是对中间图像进行一次分类。 作者报告,在 CIFAR-10 的该测量设置下,模型解决“车辆还是动物”等粗粒度问题时的噪声水平,约为解决“哪一种动物”等细粒度问题时的两倍。这里比较的是噪声水平,不能直接解释为去噪步数或生成耗时的两倍。 较廉价的代理方法观察分类器对两个类别的判断何时分裂为两个不同群组,并以对应噪声水平估计决策时机。作者报告,该代理与直接测量所得决策顺序的秩相关为 0.73–0.88,但不能准确恢复具体决策时机;所给材料未说明该范围对应的模型、类别组合或其他评估条件。 摘要提及随后比较预训练模型,但后续文字缺失,无法核对比较对象及结论。模型配置、噪声参数化、续采样次数、类别判定方式、实验协议、消融及统计信息尚未验证。材料未提供 EEG 或 BCI 实验,也未建立具体迁移机制,不能据此认定其具有神经信号生成或解码收益。

阅读价值

值得阅读的是以重复续采样估计 committor,将扩散生成中的类别承诺时机转化为可测量对象,并检验廉价分类器代理能否区分决策顺序与准确时机。

来源:arXiv · 多模态与生成机制 · arxiv.org