跳到正文
arXiv · 表征与预训练· Kishor Kumar Bhaumik; Nicolas Roque dos Santos; Neil Shah; Jia Chen; Evangelos E. Papalexakis·· 6 天前精选AI 评分75

将聚类有效性指标用作文本表征学习的自监督目标

Cluster Validation Indices as Self-Supervised Objectives for Text Representation Learning

AI 导读

基于摘要分析。本文研究如何在不依赖额外负样本、数据增强或辅助图数据的条件下,对预训练语言编码器进行自监督微调,提出 SilK(Silhouette-guided K-means),将内部聚类质量指标用作训练目标,以降低表征学习的计算与显存开销。 核心机制是先对语料进行聚类,再将简化的 silhouette(轮廓系数)回归至目标值。每篇文档仅与 k 个聚类中心比较,不与其他文档直接比较,因此每篇文档只需一个视图,无需负样本对或数据增强。其与摘要所述对比学习及无负样本方法的区别,在于以聚类中心和内部聚类质量度量提供监督信号,而非依赖批内负例或辅助图/网络。目标值、简化轮廓系数的定义、聚类更新方式及具体损失尚未验证。 作者报告:在 BERT-base 上,SilK 的每轮训练速度为所评估最快基线的 1.46 倍,峰值 GPU 显存占用比所评估显存占用最低的基线减少 45.4%;在冻结编码器的线性探测协议下,三个下游任务的表现与最佳基线具有竞争力。摘要未提供任务名称、数据集、划分、基线名称或具体性能指标,不能据此认定其精度更高,也不能直接外推到其他模型规模。实验协议、消融及统计信息尚未验证。 平台推测(待验证):其机制可能用于 EEG 编码器的自监督微调,尝试减少多视图构造与批内负例的需求。可复用的是聚类中心比较和聚类质量目标;需改造的是 EEG 输入表征、距离度量及聚类更新策略。该假设依赖嵌入空间存在有意义的簇结构:低信噪比、跨被试差异和通道配置变化可能使聚类主要反映伪迹或被试身份,小数据也可能导致聚类中心不稳定。可先在固定 EEG 数据划分和同一预训练编码器上,对比原编码器、SilK 式微调及现有自监督基线,评估跨被试冻结编码器线性探测性能、训练时间与峰值显存,并检查聚类是否主要由被试身份驱动。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 SilK 如何将聚类有效性指标转化为自监督目标,以及其效率收益是否能在保持冻结编码器线性探测性能的同时复现;摘要提供了明确机制,但具体协议与统计信息尚未验证。

来源:arXiv · 表征与预训练 · arxiv.org