跳到正文
OpenReview · Representation learning· Yunpeng Tai; Ruoyu Sun·· 2024-09-27精选AI 评分73

利用无标签文本在表征层面进行上下文学习

In-Context Learning at Representation Level via Unlabeled Texts

AI 导读

基于摘要分析。本文研究大型语言模型(LLMs)的 In-Context Learning(ICL)在预训练与推理之间的差异,提出仅利用测试集无标签输入及标签空间的推理方法:分别提取示例输入的表征,再将其融合以重塑待预测输入的表征。其主要贡献是尝试在表征层面利用上下文,而不依赖示例的真实标签。 作者指出两类差异:传统 ICL 的示例中插入标签,而预训练文本通常不具有这种结构;独立抽取的示例之间语义关联较弱,不同于预训练语料中的连续文本。所提方法独立编码示例输入并融合表征,但摘要未给出融合算子、表征提取位置、预测规则或是否需要额外训练,不能据此认定具体网络结构或损失形式。“无标签”指不使用示例真实标签,并不意味着不使用标签空间。 作者报告,在摘要所述但未明确列出任务、数据划分和指标的评估中,该方法优于获得真实标签信息的传统 ICL;作者还报告,小模型使用该方法可超过更大模型的零样本表现,例如 GPT-Neo-2.7B 超过 Llama2-7B,Llama2-7B 超过 Llama2-13B。这些结论需结合具体模型配置、任务及推理预算核对,不能据此推广为普遍的模型规模优势。实验协议、消融及统计信息尚未验证;摘要表示将提供代码,当前可用性尚未确认。 平台推测(待验证):原方法依赖文本模型表征、测试集无标签样本及标签空间。若 EEG 编码器具有可比较的任务表征,独立编码并融合无标签上下文的思路可能用于跨被试或跨会话适配;可复用的是表征融合思路,需改造的是 EEG 编码器、上下文选择和类别输出映射。低信噪比、通道差异及小样本条件可能使融合放大非任务因素。一个可检验的小实验是固定 EEG 编码器,在明确允许使用目标测试集无标签样本的协议下,对比无融合与表征融合,并保持样本可见性一致、目标真实标签仅用于评估。原领域结果不构成 EEG/BCI 有效性证据,已有相关 EEG 工作尚未检索确认。

阅读价值

值得核对其无标签输入表征融合机制,以及与使用真实标签的传统 ICL 对比时的任务和推理协议;摘要报告了潜在效率优势,但具体效果与 EEG 迁移价值尚未验证。

来源:OpenReview · Representation learning · openreview.net