跳到正文

算法、任务与模态

PEFT 最新动态

PEFT 研究索引;按可核对的标签归档,不以热度评价质量。

63 条精选近 30 天 35 条共收录 72 条

更新

精选归档 · 第 4 页

1月1日周一第 61–63 条
  1. OpenReview · State space models77

    状态空间模型的参数高效微调

    基于摘要分析。本文研究以 Mamba 为代表的深度状态空间模型(SSMs)如何进行参数高效微调(PEFT),重点比较既有 PEFT 方法的适用性及不同模块的微调价值,并提出 LoRA with Selective Dimension tuning(SDLoRA)。原论文的主要研究背景是语言建模,而非 EEG 或 BCI。 作者对四种基本 PEFT 方法进行了经验评估。作者报告,在所评估的 SSM 模型和实验条件下,基于提示的方法(如 prefix-tuning)不再有效,并提供了理论分析支持;LoRA 则仍然有效。进一步的理论与实验分析表明,在其考察的 LoRA 应用方式中,仅对线性投影矩阵应用 LoRA、而不修改 SSM 模块取得最佳结果,直接用 LoRA 微调 SSM 模块效果不佳。这里的结论针对 LoRA 的施加位置,并不意味着 SSM 模块不能通过其他方式调整。 SDLoRA 将两种调整方式结合:在线性投影矩阵上应用 LoRA,同时选择性更新 SSM 模块中的部分通道和状态。作者报告,该方法在所开展的实验中优于标准 LoRA。摘要未给出具体数据集、预训练模型规模、监督与数据划分设置、评价指标、增益幅度或可训练参数量;选择规则、理论成立条件、实验协议、消融及统计信息尚未验证,也无法据此判断性能与参数开销之间的权衡。 平台推测(待验证):若已有适用于 EEG 序列的预训练 SSM,该模块级微调策略可能用于检验小数据适配时应更新哪些参数。可复用的是线性投影的 LoRA 与 SSM 通道、状态的选择性更新思路;需改造的是 EEG 输入表征、任务输出及通道对应方式。该假设依赖可用的 EEG 预训练模型与下游监督数据,不能由语言建模结果直接推出。低信噪比、跨被试分布变化和通道配置差异可能使选择性更新不足以适配目标数据,也可能在小样本条件下过拟合。一个可证伪的小实验是在同一 EEG 预训练 SSM、固定 Cross-subject 划分和相近可训练参数预算下,比较线性投影 LoRA 与 SDLoRA 的下游表现及跨随机种子稳定性。已有 EEG 相关工作尚未检索确认。

    阅读价值:该研究值得阅读的具体原因是,它区分了 SSM 模块与线性投影矩阵对参数高效微调的适配性,并提出可供核对与复现的 SDLoRA;其在 EEG/BCI 中的有效性尚未验证。

9月23日周六
  1. OpenReview · State space models78

    LM-Switch:通过变换词嵌入空间实现灵活的语言模型控制

    LM-Switch 研究如何高效、灵活地控制通用 LLM 的生成条件,同时尽量保持原有生成质量;其核心贡献是在输出词嵌入空间部署线性变换,以实现轻量化的条件控制。基于摘要分析,未取得论文全文。 机制方面,作者通过分析 Hidden Markov Models(HMMs)的一种变体,发现其中不同条件可以解释为输出词嵌入空间的线性变换,并据此提出 LM-Switch。摘要描述了三种操作:缩放变换以连续调节控制强度,相加多个变换以组合条件,以及将已学习的变换迁移至不同规模的 LLM。该理论结论的成立条件、线性变换的具体参数化、训练目标及跨模型迁移所需的空间对齐方式尚未验证。 作者报告,在 LM detoxification(语言模型去毒化)和 sentiment control(情感控制)任务中,仅训练模型参数的 0.2%,即可取得与先进基线相当或更优的控制表现,并更好地平衡控制效果与生成质量。该比例指训练参数占比,不等同于计算量或推理延迟降幅。作者还报告可从少量句子或一篇文档学习控制变换,并迁移至不同规模的 LLM;摘要未提供数据集、模型名称、划分方式、基线名称、具体指标或迁移结果数值,实验协议、消融及统计信息尚未验证。 复现时值得重点核对控制强度与生成质量的权衡曲线、多条件相加的有效范围、少样本学习的稳定性,以及跨模型迁移的适用条件。摘要称将在发表后公开代码,当前代码可用性与发表状态尚未验证。本研究主要对象是文本生成控制,摘要未提供 EEG 或 BCI 验证;词嵌入条件控制也不能直接视为神经信号建模机制,尚未检索确认相关 EEG 工作。

    阅读价值:值得核对其从 HMM 条件建模到输出词嵌入线性变换的理论路径,以及低参数量控制、条件组合与跨模型迁移能否在保持生成质量的前提下复现;这些结论目前仅有摘要支持。

9月20日周三
  1. OpenReview · EEG72

    BELT-2:面向多任务脑解码的 EEG—语言表征自举对齐

    BELT-2 研究如何将 EEG 表征与语言表征对齐,并连接大语言模型(LLMs)以支持多任务脑解码;核心方法结合 BPE 级对齐、多任务 EEG 编码器与 prefix-tuning。基于摘要分析,未取得论文全文。 技术机制方面,作者采用 byte pair encoding(BPE)级 EEG—语言对齐,并在 EEG 领域联合进行多任务训练与解码;随后利用 EEG 编码器的中间输出,通过 prefix-tuning 连接 LLMs。该设计将 EEG 表征学习与语言生成接口结合,但摘要未说明 EEG 与 BPE 单元的对应构造、对齐损失、多任务的具体组成、LLM 型号,以及训练时哪些模块冻结或更新,相关细节尚未验证。 结果方面,作者报告在 ZuCo 数据集上获得 BLEU-1 为 52.2% 的解码结果,但摘要未提供数据划分、被试内或跨被试协议及对照基线,因此不能据此判断跨被试泛化能力。作者还报告在其他翻译基准上提升 31%–162%,但未明确基准名称、指标、对照方法及提升的计算口径,不能将其解释为准确率或百分点提升。作者声称该方法能够从非侵入式脑信号解码连贯、可读的句子,并声称相关设计具有首次性;这些主张尚需正文与既有工作核对。 复现时需核对 EEG 预处理、EEG—文本配对方式、训练与测试划分、多任务监督来源,以及文本生成阶段是否使用额外文本条件。尤其应区分 EEG 提供的信息与 LLM 语言先验对生成质量的贡献;摘要不足以确定这一贡献分解。实验协议、消融及统计信息尚未验证。摘要称代码可通过匿名链接获取,但当前材料未给出该链接,代码可访问性与复现条件尚未验证。

    阅读价值:值得阅读的具体原因是 BELT-2 将 BPE 级 EEG—语言表征对齐、多任务训练与 LLM prefix-tuning 结合,可用于考察语言先验与 EEG 表征对文本解码的各自贡献,但其评估协议与提升幅度仍需全文核对。