跳到正文
OpenReview · State space models· Edward Milsom; Ben Anson; Laurence Aitchison·· 2025-01-01精选AI 评分80

函数空间学习率

Function-Space Learning Rates

AI 导读

基于摘要分析。该研究关注参数更新如何改变神经网络的输出函数,提出逐层函数空间学习率的测量与设定方法,并引入 FLeRM(Function-space Learning Rate Matching),用于跨模型规模迁移超参数。 传统学习率描述参数空间中的更新幅度,函数空间学习率则衡量某个参数张量更新引起的输出函数变化。作者提出,通过训练开始时或训练期间周期性执行少量额外反向传播,可测量并设定任意神经网络的函数空间学习率;作者称其计算开销较小,但摘要未给出具体开销或测量公式。 该方法有两类用途:分析标准优化器在函数空间中的训练动态,以及匹配不同规模模型的函数更新幅度。FLeRM 先记录小型、低成本基础模型训练时的函数空间学习率,再自动调整较大模型的逐层参数空间学习率,使其保持一致的函数空间更新。作者报告,该方法可跨模型宽度、深度、初始化尺度及 LoRA rank 迁移超参数,涉及带残差连接的 MLP 和采用不同层归一化方案的 transformer。摘要未提供任务、数据集、评估指标、对照基线或量化收益;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型扩宽、加深或改变 LoRA rank 后,参数学习率难以直接沿用,FLeRM 的更新幅度匹配机制可能减少重复调参。可复用的是逐层函数变化测量与学习率匹配流程;需核对并适配输出函数的定义、测量样本的选择及 EEG 任务损失。该机制依赖基础模型训练轨迹和函数变化的估计,具体数据、监督形式与规模要求尚未验证。低信噪比、小数据、跨被试分布差异或通道配置变化,可能使测得的更新幅度无法代表泛化性能。 一个可检验的小实验是:固定 EEG 数据、被试划分、训练预算与任务损失,仅改变模型宽度,对比直接沿用学习率、独立调参与 FLeRM 的函数更新一致性及同一评估协议下的任务指标。该实验属于迁移假设,并非论文已验证结果;已有 EEG 相关工作尚未检索确认。

阅读价值

值得关注其以函数空间更新幅度校准逐层学习率的机制,尤其是跨模型规模与 LoRA rank 的超参数迁移;其在 EEG 小数据训练中的适用性尚未验证。

来源:OpenReview · State space models · openreview.net