学习率衰减 使用指南
按指数或阶梯衰减策略计算当前训练步的学习率,适用于学习率调度配置、收敛速度调优与训练曲线诊断。
计算公式与原理
lr(epoch) = lr₀ × γ^epoch(指数衰减,γ<1)
指数衰减让学习率随轮数几何级下降,早期大步探索、后期小步精修,有利于跳出尖锐极小值。γ 常取 0.9–0.99 或按验证指标下降时再降(ReduceOnPlateau);搭配 warmup 可避免训练初期大学习率导致发散。
使用步骤
- 填写「初始 LR」。
- 填写「衰减率」。
- 填写「轮数」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 指数衰减 lr=lr₀·γ^t;阶梯衰减每 N 步乘一次因子;余弦退火平滑降至近 0。
- 衰减让训练初期大步探索、后期细调,提升收敛质量与稳定性。
- 衰减策略需与总步数匹配,过早或过猛会陷入局部或过慢。
算例参考
- 指数衰减:lr₀=0.1, γ=0.95, 第 20 步 → lr=0.1×0.95²⁰≈0.0359。每步小幅下降,20 步后约为初始的 36%。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 余弦退火为什么流行?
- 它在训练中后段平滑降到很低,利于精细收敛且对超参不敏感,常配合预热使用;相比阶梯衰减更平滑、易复现好结果。
- 学习率衰减和预热能同时用吗?
- 能且常见:先线性预热到峰值再余弦衰减(warmup+cosine),兼顾初期稳定与后期收敛,是大模型训练标配。