跳到正文
arXiv · 在线与高效推理· Muhammad Azeem Lodhi; Chao Zhou; Rebekka Burkholz·· 4 天前精选AI 评分73

RoSA:用于显存高效微调的轮换式稀疏适应

RoSA: Rotational Sparse Adaptation for Memory-Efficient Fine-Tuning

AI 导读

基于摘要分析。RoSA(Rotational Sparse Adaptation)针对基础模型微调的显存开销,将适应过程限制在每次仅训练部分层,而不是仅减少各层内的可训练参数。其贡献是提供一种可与参数高效微调(PEFT)或稀疏优化器组合的层级训练策略。 核心机制是:训练期间始终冻结靠近输入的底层,在后续层之间轮换可训练块,并逐步增加靠近输入的冻结层数量。摘要指出,这种设计能够减少优化器状态占用并缩短反向传播;若缓存最后一个冻结层的激活,还可减少后续训练所需的前向计算。激活缓存带来的存储成本、有效条件,以及可训练块的大小、轮换顺序和冻结日程均尚未验证。 作者报告,在多个 LLM 架构与任务上的实验中,RoSA 降低了峰值显存,同时保持较强的微调性能。摘要未提供模型名称、任务、数据划分、对照方法、性能指标或具体降幅,因此尚不能量化显存与任务性能的权衡;实验协议、消融及统计信息尚未验证。 平台推测(待验证):该机制可能用于分层 EEG 基础模型的低资源微调,但 LLM 上的结果不等于 EEG/BCI 上有效。可复用的是层级冻结、可训练块轮换及其与 PEFT 的组合;需改造的是 EEG 输入与通道适配方式、冻结边界和缓存策略。低信噪比、跨被试或通道变化可能要求底层表征继续适应,过早冻结可能限制性能,小数据下轮换训练也可能不稳定。一个可检验的小实验是在固定 Cross-subject 划分和相同训练预算下,比较同一 EEG 模型使用 PEFT 与 PEFT 加 RoSA 时的峰值显存、训练耗时及同一任务指标,并核对缓存是否改变数据增强流程。已有 EEG 相关工作尚未检索确认。

阅读价值

值得核对 RoSA 的层级轮换与激活缓存如何在保持微调性能的同时降低峰值显存,以及它与现有 PEFT 方法组合时的实际收益与适用条件。

来源:arXiv · 在线与高效推理 · arxiv.org