Hölder 平滑性下归一化梯度下降的末次迭代收敛速率
Last-Iterate Convergence Rate of Normalized Gradient Descent under Hölder Smoothness
基于摘要分析。本文研究归一化梯度下降在凸、(ν, M_ν)-Hölder 平滑目标上的末次迭代收敛,回应理论分析常关注最佳迭代或加权平均迭代、实际实现却通常返回末次迭代的差异。核心贡献是分析恒定步长的末次迭代误差上界,并给出无需预先知道 ν 和 M_ν 的线性递减步长方案。 作者报告,在上述凸性与 Hölder 平滑性前提下,恒定步长的末次迭代收敛上界为 O((log²(T)/T)^((1+ν)/2)),相较已知最佳迭代及加权平均迭代的 O(T^(-(1+ν)/2)) 保证存在对数开销。摘要指出,ν=0 时该开销已知不可避免;这一表述不能扩展为所有 ν 下均不可避免。 作者还使用 performance estimation problem(PEP)开展数值分析,考察平滑情形中有限迭代预算下的最坏情况,以及对数开销是否属于恒定步长归一化梯度下降的内在限制。摘要未给出具体数值或这一问题的最终判定。对于线性递减步长,作者报告末次迭代可达到 O(T^(-(1+ν)/2)),在阶数上匹配最佳迭代及加权平均迭代保证,且不需要知道 ν 和 M_ν。步长的完整定义、其他常数依赖、证明条件与 PEP 设置尚未验证。 平台推测(待验证):该结果可为 EEG 中满足相应假设的凸优化子问题提供步长调度参考,并非已证实的 BCI 性能提升。可复用的是归一化更新与递减步长思想;应用时需核对目标的凸性、平滑性及梯度获取条件。低信噪比、小样本与跨被试差异可能影响梯度可靠性,而非凸模型训练不在摘要所述保证范围内。一个可检验的小实验是在满足假设的 EEG 凸目标上,固定数据划分与迭代预算,对比恒定和线性递减步长的末次迭代目标差距,并分别记录最佳迭代与加权平均迭代结果。已有 EEG 相关工作尚未检索确认。
值得核对其末次迭代收敛证明与步长调度条件:作者报告线性递减步长可在未知 Hölder 平滑参数时消除理论上界中的对数开销,但该结论不能直接外推至非凸 EEG 模型训练。
来源:arXiv · 学习目标与优化 · arxiv.org