跳到正文
OpenReview · Representation learning·· 23 天前精选AI 评分80

RiT:标准扩散 Transformer 在表征空间中已足够

RiT: Vanilla Diffusion Transformers Are Enough in Representation Space

AI 导读

基于摘要分析。本文研究图像生成中的流匹配学习:预训练表征空间是否比像素空间提供更有利的回归分布,以及这种优势能否减少专用架构设计。作者提出 Representation Image Transformer(RiT),在冻结的 DINOv2 特征上训练标准 Diffusion Transformer,以预测干净数据点而非环境空间中的速度,并加入维度感知噪声调度及联合 [CLS]-patch 建模。 机制与对照:作者比较像素、SD-VAE 和 DINOv2 特征的几何与统计性质,报告像素与 DINOv2 的内在维度近乎相同,但 DINOv2 具有更高的有效秩、更好的协方差条件性、更低的超额峰度及更低的流形上插值误差;SD-VAE 的表现居中。作者据此认为,优势主要来自表征学习目标而非压缩本身,并认为这些性质使流匹配回归更易优化,无需此前 DINOv2 扩散方法采用的专用预测头或黎曼传输。摘要中的预测参数化符号和内在维度数值未完整显示,不能补全。 结果:在 ImageNet 图像生成评估中,作者报告无引导时 FID 为 1.45,使用 classifier-free guidance 时为 1.14,并报告相较摘要所列 DiT 对照具有更好的结果和更少参数(676M 对 839M)。但图像分辨率、对照型号的完整符号及详细评估协议未完整提供,不能据此作严格的同协议比较。作者还报告所得 ODE 可用较粗的 Heun 离散化求解,无需蒸馏或一致性训练;具体步数在材料中缺失。代码与模型权重为计划发布,不代表已经可用。实验协议、消融及统计信息尚未验证。 平台推测(待验证):可迁移的假设是,若冻结的 EEG 表征也能改善协方差条件性和分布形态,表征空间流匹配可能比原始信号空间更易训练;这不是已证实的 BCI 效果。可复用的是流匹配与几何诊断思路,需改造特征编码器、时间与通道结构以及信号重建模块。低信噪比、跨被试差异和小数据可能使表征丢失任务信息。小规模检验可在固定被试划分下比较原始 EEG 与冻结表征的几何统计及生成质量,同时检查下游任务信息是否保留。已有相关 EEG 工作尚未检索确认。

阅读价值

值得核对其表征几何分析与简化生成架构之间的证据链:作者将学习优势归因于 DINOv2 特征的统计性质而非单纯压缩,但具体实验协议及其对 EEG 的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net