面向大语言模型参数高效微调的动态位置注意力调制
Dynamic Positional Attention Modulation for Parameter-Efficient Fine-Tuning of Large Language Models
基于摘要分析。该研究针对大语言模型参数高效微调(PEFT)中均匀、静态适配难以反映注意力在维度、注意力头、层及输入 token 间结构差异的问题,提出 DyPAM(Dynamic Positional Attention Modulation)。其核心贡献是在不修改预训练骨干的前提下,直接调制 query 与 key 表示,以适配位置信息对注意力的贡献。 机制上,DyPAM 将输入条件化的逐维调制与逐注意力头、逐层的结构调制结合,使位置注意力适配与 rotary positional embeddings(RoPE)引入的维度相关位置结构相协调。相较于摘要所描述的均匀、静态 PEFT,其区别在于适配粒度和输入依赖性;具体调制函数、插入位置、初始化、训练目标及参数开销尚未验证。 作者报告,在多个骨干模型上的数学推理与常识推理基准中,DyPAM 持续优于已有强 PEFT 基线。摘要未提供模型及基准名称、评估指标、具体分数或对照配置,因此无法量化收益或判断效率权衡;实验协议、消融及统计信息尚未验证。复现时需核对可训练参数量、训练预算、序列长度与 RoPE 配置,并区分输入条件化调制和头、层结构调制各自的贡献。 平台推测(待验证):迁移假设是,在使用 RoPE 的 EEG Transformer 中,位置结构感知的 query/key 调制可能提供低参数量适配方式,但原领域结果不等于 EEG/BCI 有效。可复用的是位置注意力调制思路,需改造的是 EEG 时间 token 的构造及其位置尺度;其依赖预训练骨干的注意力结构,下游监督与数据规模需求尚未验证。EEG 的低信噪比、跨被试差异、通道变化和小数据可能使动态调制学习到伪相关。一个可证伪的小实验是在固定被试划分的跨被试任务中,比较同一 RoPE 骨干上的 DyPAM、静态调制与常规 PEFT,匹配可训练参数量和训练预算;已有 EEG 相关工作尚未检索确认。
值得核对 DyPAM 如何利用 RoPE 的维度位置结构实现细粒度 PEFT,以及其相对强 PEFT 基线的收益是否在可训练参数量与训练预算可比时仍成立。
来源:arXiv · 在线与高效推理 · arxiv.org