學習率衰減 使用指南
按指數或階梯衰減策略計算當前訓練步的學習率,適用於學習率排程配置、收斂速度調優與訓練曲線診斷。
計算公式與原理
lr(epoch) = lr₀ × γ^epoch(指數衰減,γ<1)
指數衰減讓學習率隨輪數幾何級下降,早期大步探索、後期小步精修,有利於跳出尖銳極小值。γ 常取 0.9–0.99 或按驗證指標下降時再降(ReduceOnPlateau);搭配 warmup 可避免訓練初期大學習率導致發散。
使用步驟
- 填寫「初始 LR」。
- 填寫「衰減率」。
- 填寫「輪數」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 指數衰減 lr=lr₀·γ^t;階梯衰減每 N 步乘一次因子;餘弦退火平滑降至近 0。
- 衰減讓訓練初期大步探索、後期細調,提升收斂質量與穩定性。
- 衰減策略需與總步數匹配,過早或過猛會陷入區域性或過慢。
算例參考
- 指數衰減:lr₀=0.1, γ=0.95, 第 20 步 → lr=0.1×0.95²⁰≈0.0359。每步小幅下降,20 步後約為初始的 36%。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 餘弦退火為什麼流行?
- 它在訓練中後段平滑降到很低,利於精細收斂且對超參不敏感,常配合預熱使用;相比階梯衰減更平滑、易復現好結果。
- 學習率衰減和預熱能同時用嗎?
- 能且常見:先線性預熱到峰值再餘弦衰減(warmup+cosine),兼顧初期穩定與後期收斂,是大模型訓練標配。