学习率衰减 使用指南

按指数或阶梯衰减策略计算当前训练步的学习率,适用于学习率调度配置、收敛速度调优与训练曲线诊断。

计算公式与原理

lr(epoch) = lr₀ × γ^epoch(指数衰减,γ<1)

指数衰减让学习率随轮数几何级下降,早期大步探索、后期小步精修,有利于跳出尖锐极小值。γ 常取 0.9–0.99 或按验证指标下降时再降(ReduceOnPlateau);搭配 warmup 可避免训练初期大学习率导致发散。

使用步骤

  1. 填写「初始 LR」。
  2. 填写「衰减率」。
  3. 填写「轮数」。
  4. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

余弦退火为什么流行?
它在训练中后段平滑降到很低,利于精细收敛且对超参不敏感,常配合预热使用;相比阶梯衰减更平滑、易复现好结果。
学习率衰减和预热能同时用吗?
能且常见:先线性预热到峰值再余弦衰减(warmup+cosine),兼顾初期稳定与后期收敛,是大模型训练标配。
→ 打开学习率衰减工具