跳到正文
OpenReview · Representation learning·· 21 天前精选AI 评分81

从像素出发,无需预训练:在单一模型中联合生成与自监督表征学习

From Pixels, Without Pre-training: Joint Generative and Self-Supervised Representation Learning in One Model

AI 导读

基于摘要分析。本文研究图像生成对标签和预训练组件的依赖,提出 Self-conditioned Generation on Self-supervised representation(SCION),在单次训练中联合学习自监督表征、生成模型和条件嵌入先验,无需标签或预训练模型。 核心矛盾是:对比学习使用干净的增强视图,倾向于保留粗粒度、不变的语义;flow matching 使用带噪图像,需要保留细节与空间布局。SCION 采用一个同时接收扩散时间步和条件嵌入的像素空间编码器。表征学习时,条件嵌入是所有图像共享的可学习全局向量,以 [CLS] token 产生语义嵌入并接受对比损失训练;生成训练时,以图像自身的 [CLS] 嵌入作为条件,patch tokens 经解码器预测图像。模型同时学习嵌入先验,使推理采样不依赖参考图像,并通过梯度范数平衡与 stop-gradient 技巧联合优化各项损失。具体损失形式及梯度阻断位置尚未验证。 作者报告,在 ImageNet 256 × 256 的类别无条件生成中,使用相同 JiT-B/16 配方且不使用 representation guidance,SCION 的 FID 为 8.92,对照 iREPA 为 46.44、RCG 为 14.27;两种对照分别对齐或条件化于预训练 DINOv2。作者报告,采用 JiT-L/16 配方时,不使用及使用 representation guidance 的 FID 分别为 5.89 和 3.47,并称其优于采用 ADM 配方的 RCG(6.24)。后一比较涉及不同配方,不能视为严格同设置比较。摘要未提供表征质量评估;数据划分、采样设置、计算成本、消融及统计信息尚未验证。 平台推测(待验证):若将语义表征与信号重建联合学习,可能对应 EEG 中判别不变性与时空细节保留之间的矛盾。可借鉴联合优化和条件先验思路,但需改造像素编码、增强方式及噪声过程;其有效性可能受 EEG 低信噪比、通道差异、跨被试变化和小数据规模限制。一个可检验的假设是:在固定跨被试划分、仅用训练被试进行自监督训练时,联合训练比单独对比学习提供更有用的表征,可用相同下游协议比较 Balanced Accuracy。已有 EEG 相关工作尚未检索确认。

阅读价值

SCION 将对比表征学习、像素空间生成与条件嵌入先验联合训练,值得核对其如何协调语义不变性与细节保真需求;摘要中的生成结果不构成 EEG/BCI 有效性的证据。

来源:OpenReview · Representation learning · openreview.net