跳到正文
OpenReview · Representation learning· Sihyun Yu; Sangkyung Kwak; Huiwon Jang; Jongheon Jeong; Jonathan Huang; Jinwoo Shin; Saining Xie·· 2025-01-23精选AI 评分82

用于生成的表征对齐:训练 Diffusion Transformers 比你想象的更容易

Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think

AI 导读

基于摘要分析。本文研究视觉生成中扩散模型的表征学习瓶颈,提出 REPresentation Alignment(REPA):将去噪网络中带噪输入的隐藏状态投影,与外部预训练视觉编码器提取的干净图像表征对齐,以辅助生成模型训练。核心贡献是利用已有高质量表征,而非完全依赖生成模型自行学习表征。 机制与创新:作者认为,扩散去噪过程虽能形成具有判别意义的内部表征,但其质量仍落后于近期自监督学习方法;REPA 以表征对齐正则化提供外部学习目标。摘要未给出具体损失形式、对齐层位置、投影结构、编码器选择及冻结策略,这些实现细节尚未验证。 结果:作者报告,REPA 应用于 DiTs、SiTs 等扩散及流式 Transformer 后,可改善训练效率和生成质量。具体而言,在不使用 classifier-free guidance 的比较中,采用该方法的 SiT 在少于 400K 个训练步内,达到训练 7M 步的 SiT-XL 的性能,作者据此报告超过 17.5× 的训练加速;这不能直接解释为同等倍数的实际耗时节省。作者另报告,在使用 classifier-free guidance 与 guidance interval 时获得 FID=1.42,并称达到当时最先进结果。摘要未注明这些结果对应的数据集、分辨率、采样设置及完整基线,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 生成或去噪任务存在可靠的预训练 EEG 编码器,可假设借用“带噪隐藏表征对齐干净信号表征”的机制缓解表征学习困难。可复用的是对齐思路,需改造的是教师编码器、信号分段与通道对应;其依赖成对的带噪与参考信号,以及教师表征的可靠性。低信噪比、跨被试差异、通道不一致和小数据可能使教师目标失真,或抑制有用的神经信息。一个可证伪的小实验是在固定被试划分和训练预算下,对照同一 EEG 去噪模型加入与不加入对齐正则化后的重建误差及下游任务表现。此建议不是论文已验证的 BCI 结果,已有 EEG 相关工作尚未检索确认。

阅读价值

REPA 将外部预训练视觉表征引入生成模型的去噪训练,值得核对其表征对齐机制与训练效率收益;摘要提供了具体训练步数对照,但其对 EEG/BCI 的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net