跳到正文
OpenReview · Representation learning· Dejiao Zhang; Wasi Uddin Ahmad; Ming Tan; Hantian Ding; Ramesh Nallapati; Dan Roth; Xiaofei Ma; Bing Xiang·· 2024-01-01精选AI 评分75

大规模代码表征学习

Code Representation Learning At Scale

AI 导读

基于摘要分析。该研究面向源代码表征学习,针对既有工作通常在约一亿参数规模、有限预训练语料上训练的问题,提出利用大量代码数据的两阶段预训练方案,构建可直接用于下游任务的编码器;研究对象是代码,而非 EEG 或 BCI。 第一阶段将随机掩码语言建模与编程语言结构信息结合,用于训练编码器;第二阶段通过对比学习增强表征,其中难正样本与难负样本以无监督方式构造。摘要未给出结构信息的编码方式、样本构造规则、损失形式或两阶段训练配比。作者还讨论了定制的 token 级去噪、难正负样本的重要性、双模态对比学习对跨语言语义搜索的作用,以及预训练方案如何影响下游性能随模型规模变化的规律;双模态的具体组成尚未验证。 作者报告,该编码器在多种下游任务上持续优于既有模型,且优势较大,并通过详细消融分析相关因素。但摘要未提供具体数据集、划分协议、基线名称、指标或分数,因此不能量化收益或判定不同任务间的可比性。预训练语料规模、模型配置、实验协议、消融细节及统计信息尚未验证,代码与权重的可用性也尚未确认。 平台推测(待验证):可迁移的假设是,将领域结构约束融入掩码建模,再以难样本对比学习优化表征,可能有助于 EEG 自监督学习,但代码的离散语法结构并不直接对应连续、低信噪比的神经信号。可复用的是两阶段训练思路;需重新设计 EEG 的时空掩码及正负样本定义,避免把被试或通道差异误当作任务语义。小数据、跨被试差异和噪声可能导致伪正样本或伪负样本。一个可检验的小实验是在固定 EEG 数据划分和编码器条件下,对比随机掩码、时空结构掩码,以及加入难样本对比学习后的跨被试表现,检验增益是否稳定。上述为迁移假设,不是论文结果;已有 EEG 相关工作尚未检索确认。

阅读价值

值得阅读其结合代码结构的两阶段预训练及难正、难负样本构造消融,以核对表征学习收益的来源,但其对 EEG 的适用性尚未验证。

来源:OpenReview · Representation learning · openreview.net