訓練算力需求 使用指南

訓練算力需求估算器,用 Kaplan 縮放律由引數量與訓練 token 數估算總訓練 FLOPs,輔助算力規劃。

計算公式與原理

訓練 FLOPs ≈ 6·N·D(N 為引數量,D 為訓練 token 數);訓練月數 ≈ 6ND / (卡數 × 單卡算力 × 3600 × 24 × 30)

Transformer 訓練的經驗法則:前向 2N、反向約 4N,合計每 token 約 6N FLOPs,即 Chinchilla 系列縮放律推導的基礎。再除以叢集有效算力(須乘 MFU,實際常 30%–50%)得到訓練週期。

使用步驟

  1. 填寫「引數量(億)」。
  2. 填寫「訓練 tokens(億)」。
  3. 填寫「GPU 數」。
  4. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

6ND 是上限還是典型值?
6ND 是前向+反向的理論下界(理想乘加計數),實際含啟用重算、通訊與低效會更高;規劃時乘以 1.5~3 倍餘量更穩妥。
引數量和訓練資料哪個更耗算力?
二者線性相乘,等比例增。但現代訓練常'資料受限',即資料量不足以讓引數充分訓練,此時加資料比加引數更划算(直到 Chinchilla 最優點)。
→ 開啟訓練算力需求工具