跳到正文
OpenReview · Representation learning· Ruifeng Ren; Yong Liu·· 2024-09-26精选AI 评分77

从表示学习视角理解 Transformers 如何进行上下文学习

Towards Understanding How Transformers Learn In-context Through a Representation Learning Lens

AI 导读

基于摘要分析。本文研究 Transformers 的上下文学习(ICL)机制,即模型如何仅凭少量示范样例、在不更新参数的情况下执行新任务。核心贡献是借助核方法构建单个 softmax attention 层的对偶模型,从表示学习视角解释 ICL 推理,并分析示范 token 数量与泛化误差的关系。 机制方面,作者报告,attention 层的 ICL 推理过程可对应于对偶模型的训练过程,所生成的 token 表示预测与对偶模型的测试输出等价。作者进一步分析该对偶模型的训练过程,推导与示范 token 数量有关的泛化误差界,并将理论结论扩展至单个 Transformer 层及多个 attention 层。摘要未提供等价关系成立的假设、误差界的具体形式或适用分布,因此不能据此推断增加示范必然改善任意任务表现。 方法探索方面,作者受表示学习方法、尤其是对比学习启发,提出对 attention 层的潜在修改,并报告设计了实验支持研究结论。具体修改方式、训练目标、任务与数据集、对照基线、结果指标、实验协议、消融及统计信息尚未验证。 平台推测(待验证):该分析可能为 EEG 上下文示范如何影响表示提供理论切入点,但语言 token 的结论不能直接迁移为 BCI 效果。迁移假设依赖于 EEG 能否形成适合该理论的 token 表示与任务示范结构;可考虑复用 attention 与对偶模型分析框架,而 EEG 分段、通道表示及示范组织方式需要改造。低信噪比、跨被试差异、通道不一致与小样本可能使理论假设失效。待核对全文条件后,可在固定 EEG 编码器和被试内数据划分下,仅改变上下文示范数量、保持模型参数不变,检验任务误差是否符合理论预期。相关 EEG 工作尚未检索确认。

阅读价值

值得阅读的是作者通过核方法将 softmax attention 的 ICL 推理与对偶模型训练联系起来,并给出涉及示范 token 数量的泛化误差界;其假设条件及实验支持程度尚待全文核对。

来源:OpenReview · Representation learning · openreview.net