什么使合成难负样本在视觉-语言预训练中有效?
What Makes Synthetic Hard Negatives Work in Vision-Language Pretraining?
基于摘要分析。研究考察表征空间中的合成难负样本为何难以从单模态自监督学习直接迁移到视觉-语言预训练,并提出 SNAP:在模态内生成难负样本,且生成过程不涉及任一模态的匹配正样本。 作者分析了六种表征空间合成策略,指出两类迁移失效模式:跨模态构造可能产生过于容易的负样本,或使负样本向查询靠近;模态内构造则可能混入匹配正样本。作者认为,SNAP 的正样本排除机制可避开这两类问题。此外,作者观察到使用合成难负样本与可学习温度训练时出现 logit-scale 饱和,并报告固定温度能够改善下游表现。具体合成公式、负样本选择规则及温度取值尚未验证。 作者报告,在 CLIP 和 FLIP 上、覆盖多个架构与数据集的评估中,SNAP 在 zero-shot retrieval、zero-shot classification 和 linear probe evaluation 上均带来一致改善;其不依赖外部生成模型,且训练时间开销增加小于 10%。摘要未提供各项指标、增益幅度、数据划分或计时条件,因此不能据此量化收益或比较不同协议。实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 与文本或其他模态采用匹配样本进行对比预训练,该研究的负样本几何分析与正样本排除机制可能用于检查合成负样本质量。可复用的是表征空间合成和温度控制思路,需改造的是 EEG 配对定义及负样本筛选;低信噪比、跨被试差异、通道变化和小数据可能使几何邻近性不再对应语义难度。可在固定编码器、数据划分与训练预算下,对比无合成负样本、SNAP,以及固定或可学习温度,检验跨被试检索表现是否稳定改善。相关 EEG 工作尚未检索确认,此迁移假设不构成已验证的 BCI 效果。
值得阅读其对跨模态合成负样本几何失效模式及温度设置的分析,并复现 SNAP 的正样本排除机制;摘要报告了多种下游任务改善,但具体增益与实验协议尚未验证。
来源:arXiv · 表征与预训练 · arxiv.org