跳到正文
OpenReview · Representation learning·· 21 天前精选AI 评分75

非对称 Diffusion Transformer:通过训练期查询进行表征监督

Asymmetric Diffusion Transformer: Representation Supervision via Training-Time Queries

AI 导读

基于摘要分析。本文研究如何利用预训练表征训练 diffusion transformer,提出 Asym-DiT:将表征作为仅在训练时使用的查询引入 transformer,但不让其条件化生成路径,以此提供表征监督而不增加推理成本。原论文的主要对象是扩散生成模型,并非 EEG 或 BCI。 核心机制是非对称注意力掩码:表征 token 可以读取 latent,而 latent 不能读取表征 token。表征通过读取 latent 完成自身的去噪任务,其损失仅经反向传播影响 latent 的隐藏状态,使后者暴露表征任务所需的信息;推理时移除表征查询。这里并非没有损失,而是不通过显式对齐损失规定 latent 隐藏状态应具有何种表征形式。 对照方法包括 representation alignment(REPA)与 joint diffusion:前者用显式损失将内部激活拉向外部预训练表征,后者将表征引入模型并与 latent 一同生成。作者认为,Asym-DiT 不固定隐藏状态形式,因此较少与生成目标竞争。作者报告其在 REPA 收益停滞时仍有帮助,随模型规模增大具有更好的扩展表现,并在微调已训练 transformer 时获得较大收益;摘要未给出数据集、评估指标、模型规模、具体增益或微调协议,尚不能核对这些比较的适用范围。预训练表征来源、去噪目标、损失权重、实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可作为 EEG 扩散生成或重建模型中辅助表征监督的假设路径,对应的是如何引入预训练知识而不约束生成隐藏状态形式的问题。可复用非对称掩码与训练期辅助查询,但需改造 EEG token 化、表征来源及去噪任务;原方法所依赖的数据规模与监督条件尚未明确。低信噪比、跨被试及通道差异可能使辅助表征强调非目标因素,小数据条件下也可能过拟合。一个可检验的小实验是在固定 EEG 数据划分、骨干和训练预算下,对比无辅助监督、REPA 与训练期查询,分别核对生成或重建质量及推理开销。已有 EEG 相关工作尚未检索确认,原领域结果不构成 BCI 有效性的证据。

阅读价值

值得核对其非对称注意力与训练期查询机制能否在不增加推理成本的前提下改善表征监督,尤其是作者报告的相对 REPA 的模型规模扩展与已训练模型微调收益。

来源:OpenReview · Representation learning · openreview.net