用于测试时扩散对齐的 Best-of-$N$ 引导
Best-of-$N$ Guidance for Test-time Diffusion Alignment
基于摘要分析。研究针对扩散模型生成样本与奖励模型所衡量的人类偏好之间的对齐问题,提出 Best-of-$N$ Guidance(BoNG):将 Best-of-$N$(BoN)的择优原则嵌入反向扩散过程,而不是仅在生成结束后选择最高奖励样本,目标是同时改善最佳输出与生成群体的平均质量。 传统 BoN 从预训练扩散模型独立同分布地抽取 N 个样本,并只输出奖励最高者;奖励信息不参与去噪轨迹调整。BoNG 则在去噪粒子之间进行在线 BoN 选择,以当前最优粒子引导其余粒子,通过非对称粒子交互将群体推向更高奖励区域。摘要未给出中间粒子的奖励估计方式、引导公式或具体采样调度,这些机制细节尚未验证。 作者报告,在与 SMC 和 Vanilla BoN sampling 比较的 36 项实证比较中,BoNG 在 29 项中表现最佳,占 80.56%。作者还报告,在多输出评估中,相较摘要所称的最新基于采样的引导方法,BoNG 获得 1.3 倍的 ImageReward 分数及 1.6 倍的速度提升。摘要未明确这些比较所用的数据集、模型、采样预算、对照方法名称及运行硬件,因而不能据此判断收益在不同协议下是否稳定;奖励分数提升也不能直接等同于人类评价提升。实验协议、消融及统计信息尚未验证。摘要提供了代码仓库地址,但实现与复现条件尚未核验。 平台推测(待验证):若用于 EEG 条件生成或数据增强,其可复用部分是采样阶段的粒子择优与交互引导,但需要适合 EEG 的条件约束和质量奖励,不能直接沿用 ImageReward。假设奖励能反映生理合理性及任务相关性,可在固定生成预算下比较独立 BoN 与 BoNG 的平均奖励、样本多样性及下游任务表现;低信噪比、跨被试差异、通道配置变化和小数据可能使奖励失真,粒子趋同也可能降低多样性。上述迁移并非本文已验证结果,已有 EEG 相关工作尚未检索确认。
值得核对其将末端奖励筛选改为去噪过程中的粒子引导机制,以及在相同采样预算下能否同时提高最佳样本与样本群体的平均奖励。
来源:arXiv · 多模态与生成机制 · arxiv.org