學習率衰減 使用指南

按指數或階梯衰減策略計算當前訓練步的學習率,適用於學習率排程配置、收斂速度調優與訓練曲線診斷。

計算公式與原理

lr(epoch) = lr₀ × γ^epoch(指數衰減,γ<1)

指數衰減讓學習率隨輪數幾何級下降,早期大步探索、後期小步精修,有利於跳出尖銳極小值。γ 常取 0.9–0.99 或按驗證指標下降時再降(ReduceOnPlateau);搭配 warmup 可避免訓練初期大學習率導致發散。

使用步驟

  1. 填寫「初始 LR」。
  2. 填寫「衰減率」。
  3. 填寫「輪數」。
  4. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

餘弦退火為什麼流行?
它在訓練中後段平滑降到很低,利於精細收斂且對超參不敏感,常配合預熱使用;相比階梯衰減更平滑、易復現好結果。
學習率衰減和預熱能同時用嗎?
能且常見:先線性預熱到峰值再餘弦衰減(warmup+cosine),兼顧初期穩定與後期收斂,是大模型訓練標配。
→ 開啟學習率衰減工具