函数空间学习率
Function-Space Learning Rates
基于摘要分析。本文研究参数更新对神经网络输出函数的影响,提出逐层函数空间学习率的测量与设定方法,并通过 FLeRM(Function-space Learning Rate Matching)实现跨模型规模的超参数迁移。其核心区别在于:传统学习率描述参数空间中的变化幅度,而函数空间学习率衡量某个参数张量更新引起的输出函数变化幅度。 机制与应用:作者提出适用于任意神经网络的高效测量与设定方法,称只需在训练开始时或训练期间定期增加少量反向传播,即可获得函数空间学习率。论文据此分析标准优化器的函数空间动态;FLeRM 则先记录小型、低成本基础模型训练中的函数空间学习率,再自动调整较大模型的逐层参数空间学习率,使函数空间更新保持一致。摘要未给出变化幅度的具体度量、估计所用样本、匹配公式或优化器适配细节,这些尚待全文核对。 作者报告:FLeRM 可在模型宽度、深度、初始化尺度及 LoRA rank 变化时迁移超参数,涉及带残差连接的 MLP 和采用不同 layer normalisation 方案的 transformers。摘要未提供任务、数据集、模型规模、对照基线、性能数值或运行成本测量,因此尚不能量化迁移收益;实验协议、消融及统计信息尚未验证。 平台推测(待验证):若 EEG 模型规模变化导致相同参数空间学习率产生不同的输出扰动,函数空间更新匹配可能减少跨规模学习率搜索。该假设可复用逐层测量和学习率调整机制,但需明确匹配 EEG 分类输出还是表征,并用具有代表性的训练数据估计更新幅度;摘要未说明该估计对监督形式、样本量及数据分布的依赖。低信噪比、小样本、跨被试分布差异和通道配置变化可能使测量不稳定,输出更新一致也不保证泛化一致。一个可检验的小实验是在固定 EEG 数据划分与预处理下,以小模型记录的函数空间学习率指导较宽模型训练,对比直接沿用学习率和相同搜索预算的调参方案,同时记录分类指标、测量开销及多随机种子稳定性。已有 EEG 相关工作尚未检索确认。
值得阅读的具体原因是 FLeRM 将跨模型规模的学习率迁移转化为逐层输出函数变化的匹配问题,可重点核对其测量成本与宽度、深度及 LoRA rank 变化下的适用边界,EEG/BCI 有效性尚未验证。
来源:OpenReview · State space models · openreview.net