跳到正文
OpenReview · Representation learning· Anastasia Razdaibiedina; Ashish Khetan; Zohar Karnin; Daniel Khashabi; Vivek Madan·· 2023-10-08精选AI 评分76

表征投影不变性缓解表征坍塌

Representation Projection Invariance Mitigates Representation Collapse

AI 导读

基于摘要分析。本文研究预训练语言模型微调时的表征退化(表征坍塌)问题,提出 Representation Projection Invariance(REPINA)正则化,通过抑制不期望的表征变化来维持表征的信息含量。研究同时扩展了表征坍塌的分析,并提出若干量化指标。 机制与证据:摘要将 REPINA 描述为作用于微调过程的表征约束,但未提供投影操作、约束对象或损失的具体形式,这些细节尚未验证。作者报告,在包含 GLUE benchmark 和六个额外数据集的 13 项语言理解任务上,与 5 个可比基线进行域内评估时,REPINA 在其中 10 项任务上优于其他基线。作者还报告分布外表现改善、少样本设置下有效,以及对标签扰动具有鲁棒性;摘要未给出相应指标、效应大小及具体协议,不能据此比较不同评估条件下的收益。作者报告其方法更有效地缓解表征坍塌,但坍塌指标与下游性能之间的关系仍需核对正文。 平台推测(待验证):迁移假设是,若预训练 EEG 表征在小样本任务微调中也出现信息退化,类似表征正则化可能有助于保留可迁移信息。原方法依赖预训练语言模型的上下文表征与下游微调流程;其具体监督条件、数据规模要求及投影机制尚未验证。可借鉴的是约束表征变化和量化坍塌的思路,需改造的是 EEG 时间窗、通道结构及预训练与微调表征的对应方式。低信噪比、跨被试差异及通道变化可能使约束保留噪声或被试特异信息,过强约束也可能阻碍任务适应。 可检验的小实验:取得完整方法后,在固定的 Cross-subject EEG 划分下,对同一预训练模型比较常规微调与加入 REPINA 的微调,统一标签预算和调参规则,同时观察任务指标及表征坍塌指标是否共同改善。此方案并非已验证结果;已有 EEG 相关工作尚未检索确认。完整实验协议、消融及统计信息尚未验证。

阅读价值

REPINA 将微调中的表征坍塌缓解与域内、分布外及少样本表现联系起来,值得核对其正则化定义、坍塌度量及基线比较,但其对 EEG 微调的价值尚未验证。

来源:OpenReview · Representation learning · openreview.net