跳到正文
OpenReview · Representation learning· Yazhe Li; Jörg Bornschein; Ting Chen·· 2024-01-01精选AI 评分74

去噪自回归表征学习

Denoising Autoregressive Representation Learning

AI 导读

基于摘要分析。本文研究视觉表征学习,提出 DARL,以 decoder-only Transformer 自回归预测图像 patch,并通过去噪 patch 解码器引入扩散目标,探索兼顾视觉感知与图像生成的统一模型。 机制与贡献:作者报告,仅使用 Mean Squared Error(MSE,均方误差)训练即可获得较强的视觉表征;为增强图像生成能力,方法以扩散目标替换 MSE。作者进一步报告,在更大模型中采用针对性噪声调度并延长训练,可以改善表征质量,且表征学习的最优噪声调度与标准图像扩散模型常用调度显著不同。这提示生成目标的配置需要围绕表征学习重新评估,不能直接沿用图像生成设置。 结果与证据边界:作者报告,在微调评估协议下,DARL 的性能接近先进的掩码预测模型。摘要未提供具体数据集、划分、指标数值、对照模型名称、模型规模或训练预算,因此无法量化差距或判断计算成本。扩散目标的具体形式、噪声调度参数、实验协议、消融及统计信息尚未验证,代码与复现条件也尚未验证。 平台推测(待验证):假设将图像 patch 改为 EEG 时间片段或时空片段,自回归上下文预测与局部去噪可能用于学习可迁移表征,对应 EEG 低信噪比及标签稀缺问题。可考虑复用自回归与去噪训练框架,但需改造片段编码、通道组织和噪声机制;跨被试差异、通道不一致及小数据条件下的训练不稳定,可能使模型主要学习噪声或被试特征。一个可检验的小实验是在固定 EEG 数据划分、模型容量和训练预算下,对比 MSE 自回归预训练与去噪目标预训练,并在相同跨被试微调协议下评估,同时仅改变噪声调度以核对其作用。上述属于迁移假设,不是本文已证实的 EEG/BCI 效果;已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 DARL 中自回归预测、去噪目标与表征质量之间的关系,尤其是作者报告的表征学习最优噪声调度不同于标准图像扩散模型这一现象;其 EEG 适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net