跳到正文
OpenReview · Representation learning· Dejiao Zhang; Wasi Uddin Ahmad; Ming Tan; Hantian Ding; Ramesh Nallapati; Dan Roth; Xiaofei Ma; Bing Xiang·· 2024-01-16精选AI 评分75

大规模代码表征学习

CODE REPRESENTATION LEARNING AT SCALE

AI 导读

基于摘要分析。本文研究源代码表征学习,针对既有工作多采用亿级参数模型、预训练语料有限的问题,提出利用大量代码数据的两阶段预训练方案,目标是获得可直接用于多种下游任务的编码器,而非专门研究 EEG 或 BCI。 第一阶段结合掩码语言建模的随机性与编程语言的隐式结构、语义信息训练编码器;第二阶段通过无监督构造的难负样本和难正样本进行对比学习,进一步增强表征。摘要还提到面向源代码定制的 token 级去噪方案,以及用于提升跨语言语义搜索的 bimodal contrastive learning,但未说明具体去噪操作、样本构造规则或两种模态的定义,不能据此补写损失形式和模型结构。 作者报告,所获编码器在多种下游任务上持续优于现有模型,且提升幅度较大;摘要未提供任务清单、数据集、划分、基线或具体指标,因此尚不能量化或独立核对这一结论。作者称开展了详细消融,分析定制去噪、难正与难负样本、双模态对比学习,以及预训练方案如何影响下游性能随模型规模变化的规律。实验协议、消融细节及统计信息尚未验证,实际模型规模、语料规模和复现条件也需查阅全文。 平台推测(待验证):可迁移的机制假设是“结构感知去噪加难样本对比学习”可能有助于缓解 EEG 表征预训练中随机掩码未充分利用时空结构的问题,但编程语言结构与 EEG 生理结构并不等价。可复用两阶段训练思路,需重新定义 EEG 的掩码单位、结构先验及正负样本关系;低信噪比、跨被试差异、通道配置变化和小数据规模可能导致难样本实际反映噪声或被试身份。一个可检验的小实验是在固定 EEG 数据划分、编码器与训练预算下,对照随机掩码、结构感知掩码及加入难样本对比学习的方案,比较相同跨被试协议下的下游表现,并核对错误正负配对的影响。已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其源码 token 级去噪与无监督难正、难负样本构造的消融分析,以核对两阶段预训练如何影响代码表征及模型规模收益;对 EEG 的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net