表征对齐中什么更重要:全局信息还是空间结构?
What matters for Representation Alignment: Global Information or Spatial Structure?
基于摘要分析。本文研究视觉生成模型中的表征对齐:将预训练视觉编码器的表征蒸馏到扩散模型中间特征时,生成效果主要受目标表征的全局信息还是空间结构影响。作者报告,跨 27 个视觉编码器及不同模型规模的分析显示,相较于全局分类表现,空间结构更能解释目标表征对生成性能的作用,并据此提出 iREPA。 研究以 ImageNet1K Accuracy 衡量全局信息,以 patch token 之间的两两余弦相似度刻画空间结构。iREPA 在 REPA 中将标准 MLP 投影层替换为简单卷积层,并对外部表征引入空间归一化层,旨在增强空间信息的传递。摘要未提供归一化公式、对齐损失或卷积配置,不能据此确定具体实现。 作者报告,这些改动的实现少于 4 行代码,并在多种视觉编码器、模型规模及训练变体中持续改善 REPA 的收敛速度,列举的变体包括 REPA、REPA-E、meanflow 和 JiT。摘要未给出生成质量指标、加速幅度、训练预算及对照细节;空间结构的测量与控制方式、实验协议、消融及统计信息尚未验证。因此,目前可确认的是作者提出了空间结构重要性的经验结论,而非其已被证明具有独立因果作用。 平台推测(待验证):其可迁移假设是,若 EEG 教师表征具有可靠的通道拓扑或时间邻域结构,强调局部结构的对齐可能比单纯依赖教师分类 Accuracy 更有利于表征迁移。可复用的是教师—学生对齐思路,投影层与归一化轴则需按 EEG 通道布局和时间结构改造;低信噪比、跨被试差异、通道缺失及小数据可能使局部相似性主要反映噪声。可检验的小实验是在固定 EEG 教师、学生和训练预算下,采用相同 Cross-subject 划分,对比 MLP 投影与拓扑感知投影,并单独控制空间归一化,评估下游指标和收敛速度。原论文研究对象仍是视觉生成,上述假设不构成 BCI 有效性证据;已有 EEG 相关工作尚未检索确认。
值得核对其跨编码器分析能否区分全局识别能力与局部空间结构的作用,以及 iREPA 的两项简单改动是否稳定加快生成模型训练;其对 EEG/BCI 的适用性尚未验证。
来源:OpenReview · Representation learning · openreview.net