RouteREPA:面向 Just Image Transformers 的路由式表征对齐
RouteREPA: Routed Representation Alignment for Just Image Transformers
基于摘要分析。本文研究将表征对齐(REPA)从潜空间 diffusion transformers(DiTs)应用到像素空间 Just Image Transformers(JiT)时的表征冲突,提出 Routed Representation Alignment(RouteREPA),通过依赖表征的轻量路由器,为对齐与生成自适应路由面向任务的表征,并在多个网络深度实施路由。 核心分析:作者报告,相比潜空间对应模型,JiT 学到的表征与 DINOv2 的对齐程度明显更低;将 REPA 应用于 JiT 会持续降低其中间表征的可重建性,而在 Latent JiT 中未观察到这一效应。作者将其归因于直接重建像素的需求:不同网络深度需分层编码判别语义及与重建相关的视觉信息,因而判别式对齐目标可能与像素生成目标冲突。RouteREPA 的设计针对这种深度依赖需求,但摘要未披露路由器结构、路由粒度、具体损失形式及训练细节。 结果:在 ImageNet-1K、256×256 分辨率的实验中,作者报告 RouteREPA 在不同 JiT 模型规模及训练预算下均带来改进,并优于标准 REPA。对 JiT-H/16,作者报告在不使用 classifier-free guidance 的条件下,仅使用 PixelREPA 三分之一的训练轮数即可取得更优表现。摘要未提供具体指标、分数、绝对训练轮数及完整对照配置,因此不能据此量化性能提升或总计算成本收益。 验证边界:全文未取得,数据划分、表征可重建性的测量方式、路由消融及统计信息尚未验证。研究对象是图像生成,摘要不包含 EEG/BCI 实验;已有 EEG 相关工作尚未检索确认,不应将图像生成中的收益直接视为神经信号建模效果。
值得核对其表征可重建性分析与多深度路由实验,以判断判别式表征对齐为何可能损害像素空间生成,以及自适应路由能否缓解这一冲突;其对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · Representation learning · openreview.net