学习率衰减

📖 Learning Rate Decay Calculator

Compute the current learning rate under exponential or step decay schedules, for scheduler tuning and training-curve diagnosis.

📐 计算公式 / 原理
lr(epoch) = lr₀ × γ^epoch(指数衰减,γ<1)
指数衰减让学习率随轮数几何级下降,早期大步探索、后期小步精修,有利于跳出尖锐极小值。γ 常取 0.9–0.99 或按验证指标下降时再降(ReduceOnPlateau);搭配 warmup 可避免训练初期大学习率导致发散。

📐 计算公式与说明

LR = LR₀ × γ^epoch

指数衰减常用于后期精调。

📚 深度解析:学习率衰减

💡 常见使用场景

指数衰减
lr₀=0.1, γ=0.95, 第 20 步 → lr=0.1×0.95²⁰≈0.0359。每步小幅下降,20 步后约为初始的 36%。

❓ 常见问题(FAQ)

余弦退火为什么流行?
它在训练中后段平滑降到很低,利于精细收敛且对超参不敏感,常配合预热使用;相比阶梯衰减更平滑、易复现好结果。
学习率衰减和预热能同时用吗?
能且常见:先线性预热到峰值再余弦衰减(warmup+cosine),兼顾初期稳定与后期收敛,是大模型训练标配。