从像素出发,无需预训练:在单一模型中联合进行生成与自监督表征学习
From Pixels, Without Pre-training: Joint Generative and Self-Supervised Representation Learning in One Model
基于摘要分析。研究针对图像生成依赖类别标签、预训练编码器或独立训练自编码器的问题,提出 SCION(Self-conditioned Generation on Self-supervised representation),在单一模型中联合学习生成能力与自监督表征,并支持无需参考图像的自条件生成。 核心难点是目标不匹配:对比学习使用干净的增强视图,偏向粗粒度、具有不变性的语义;flow matching 使用含噪图像,需要保留细节与空间布局。SCION 采用受 flow 时间步与嵌入共同条件化的像素空间编码器。表征学习时,条件嵌入是所有图像共享的可学习全局向量,编码器的 [CLS] token 通过对比损失学习语义表征;生成训练时,条件嵌入改为图像自身的 [CLS] 表征,patch tokens 经解码器预测图像。模型联合学习嵌入先验,以便推理时不依赖参考图像,并通过梯度范数平衡与 stop-gradient 机制协调联合优化。具体损失形式、梯度路径及采样实现尚未验证。 作者报告,在 ImageNet 256×256、JiT-B 配方且不使用 representation guidance 的条件下,SCION 的 FID 为 8.92;摘要所列类别无条件基线中,对齐预训练 DINOv2 的 iREPA 为 46.44,以其为条件的 RCG 为 14.27。采用 JiT-L 时,作者报告无 guidance 的 FID 为 5.89,使用 representation guidance 时为 3.47;摘要另列采用 ADM 配方的 RCG 为 6.24。不同配方不能视为完全受控的直接比较,训练预算、采样设置、消融及统计信息尚未验证。摘要未提供表征下游评估,不能据生成 FID 推断表征质量。 平台推测(待验证):该机制可能对应 EEG 自监督学习中“不变性表征与信号细节保留”的冲突,但图像域结果不等于 BCI 有效。可尝试复用条件化编码器、联合优化和嵌入先验,需改造时间—通道 token 化、信号增强及生成输出。低信噪比、小数据和跨被试差异可能使表征保留伪迹或个体特征。一个可检验的小实验是在固定数据划分与训练预算下,比较仅对比学习和联合训练的 Cross-subject 解码表现,并核对生成信号的时频结构是否合理;已有相关 EEG 工作尚未检索确认。
SCION 将对比表征学习与像素空间生成整合到无需标签或预训练的联合训练流程中,值得核对其目标协调机制及不同训练配方下的生成对照,但其 EEG 迁移价值尚未验证。
来源:arXiv · 表征与预训练 · arxiv.org