通过几何协调缓解表征学习失衡
基于摘要分析。本文研究长尾分布下自监督学习(SSL)的表征失衡问题,提出 Geometric Harmonization(GH),以类别级均匀性替代仅追求样本级均匀性的优化倾向,旨在抑制头部类别主导嵌入空间、尾部类别表征被动坍缩的现象。主要研究对象是通用表征学习,并非 EEG 或 BCI。 作者将失衡归因于常规 SSL 的样本级均匀性目标:样本数量较多的头部类别占据更大表征空间,少数类别则受到挤压。GH 在自监督表征之上测量嵌入空间的总体统计,据此推断细粒度的实例级校准,约束头部类别的空间扩张并避免尾部类别坍缩。作者称该方法不改变 SSL 设定,可低成本集成到现有方法;摘要未给出统计量、校准公式、损失形式,以及无标签条件下类别级均匀性的具体实现,均需正文核对。 作者报告,在多个基准数据集及长尾分布评估中,GH 显示出有效性和对分布偏斜的较高容忍度,并称其有利于少数类别、几乎不损害多数类别。摘要未列出数据集名称、分布构造、对照方法、评价指标或具体数值;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 自监督预训练存在任务类别不均衡,GH 的嵌入统计与实例校准机制可能用于缓解多数类别主导表征的问题。可复用部分是表征空间统计及校准思路,需改造部分是 EEG 编码器与数据增强,并核对统计估计是否主要反映被试或通道差异,而非任务类别。低信噪比、小数据和跨被试差异可能使尾部结构估计不稳定。一个可检验的小实验是在固定 EEG 数据划分和自监督基线下构造训练类别不均衡,对比加入 GH 前后的尾部类别表现与 Balanced Accuracy,确保测试协议一致、校准不使用测试标签。已有 EEG 相关工作尚未检索确认。
阅读价值:值得核对 GH 如何在不改变自监督学习设定的前提下,由嵌入空间总体统计实现实例级校准,以及其对长尾类别表征失衡的改善是否适用于不同分布偏斜程度。