重新审视长尾数据下监督对比学习的表征几何
Rethinking Representation Geometry in Supervised Contrastive Learning under Long-Tailed Data
基于摘要分析。本文研究长尾分布下监督对比学习及其平衡变体是否能在最优点形成正则单纯形几何,并提出用于分析这一问题的理论框架。作者据此引入 structural balancing,提出一个在其理论条件下可于最优点形成正则单纯形几何的完全平衡对比学习目标。 核心机制与贡献:作者指出,对所分析的代表性目标而言,最优表征仍依赖各类别的样本数量,因此不能形成正则单纯形。本文的切入点不仅是平衡训练样本或类别贡献,而是检验目标函数对应的最优表征结构是否真正摆脱类别样本数量的影响。摘要未给出 structural balancing 的具体形式、损失表达式、几何分析对象及证明假设,这些均需通过全文核对。 结果与复现:作者报告,理论与实证结果支持该方法获得更平衡的表征空间,并改善长尾识别与迁移学习任务表现。摘要未提供数据集、数据划分、对照方法、指标或数值,实验协议、消融及统计信息尚未验证。作者表示代码将发布,当前材料不能确认代码已可用。 平台推测(待验证):假设 EEG 分类中的类别不均衡也会通过监督对比目标扭曲类别表征几何,该结构平衡思路可能用于检验少数类表征受挤压的问题;原领域有效并不等于 BCI 有效。可复用部分是对比目标及其几何诊断,需针对 EEG 编码器、批次采样和被试差异进行适配。其依赖带类别标签、具有类别样本数量差异的数据;低信噪比、小数据和跨被试变化可能使理想几何难以实现,且均匀类别间距未必符合 EEG 的实际类别关系。一个可证伪的小实验是在固定 EEG 数据划分、编码器和训练预算下,控制训练集类别不均衡程度,对比监督对比学习、已有平衡目标与该目标,同时检查类别几何及 Balanced Accuracy,检验几何改善是否伴随分类收益。已有 EEG 相关工作尚未检索确认。
值得阅读其对类样本数量如何影响监督对比学习最优几何的理论分析,并核对 structural balancing 的适用条件及其相对已有平衡目标的实证收益。
来源:OpenReview · Representation learning · openreview.net