跳到正文
OpenReview · Representation learning· Boyang Zheng; Nanye Ma; Shengbang Tong; Saining Xie·· 2026-01-26精选AI 评分81

采用表征自编码器的 Diffusion Transformers

Diffusion Transformers with Representation Autoencoders

AI 导读

基于摘要分析。本文研究图像潜空间生成中自编码器对 Diffusion Transformers(DiTs)的限制,提出将预训练表征编码器与训练得到的解码器组合为 Representation Autoencoders(RAEs),以替代传统 VAE 编码器—解码器。核心贡献是探索如何让 DiT 在语义丰富的高维表征空间中有效进行扩散生成,而非提出 EEG 或 BCI 方法。 作者指出,传统 VAE 存在卷积骨干较大、低维潜空间限制信息容量、纯重建训练所得表征较弱等问题。RAE 使用 DINO、SigLIP、MAE 等预训练编码器并配合训练的解码器;作者报告其兼具高质量重建与语义丰富的潜空间,并支持可扩展的 transformer 架构。这一路径依赖已有视觉预训练表征及相应重建数据,不能直接视为适用于神经信号的通用编码器。 针对高维表征给扩散建模带来的困难,作者称进行了机制分析,提出有理论动机的解决方案并作经验验证。作者报告,无需辅助表征对齐损失即可更快收敛;采用带轻量、宽 DDT-head 的 DiT 变体,在 ImageNet 图像生成中,256 分辨率下 FID 为 1.18,512 分辨率下 FID 为 1.13,并称达到最先进性能。摘要未给出具体理论方案、训练规模、采样设置及对照配置,实验协议、消融及统计信息尚未验证。 平台推测(待验证):若用于 EEG 生成或重建,可检验的假设是,将表征学习与解码重建分开,可能缓解仅依靠重建目标得到的潜空间缺少任务相关信息的问题。可借鉴编码器—解码器分工与高维潜空间扩散思路,但需改用 EEG 编码器,并改造时序、通道表示和解码器;视觉预训练语义不能直接迁移。低信噪比、跨被试差异、通道变化及小数据可能使潜空间保留伪迹或被试身份,并增加扩散训练难度。一个小规模检验是,在同一 EEG 数据集和固定跨被试划分下,对比预训练 EEG 编码器加解码器与重建型自编码器,控制扩散训练预算,同时考察重建质量、生成信号的任务相关性与收敛速度。相关 EEG 工作尚未检索确认,该实验仅为迁移假设。

阅读价值

值得阅读其用预训练表征编码器替代传统 VAE、并让 DiT 适配高维潜空间的机制分析,但具体解决方案与对照协议尚需全文核验,图像生成结果不构成 EEG/BCI 有效性的证据。

来源:OpenReview · Representation learning · openreview.net