訓練算力需求 使用指南
訓練算力需求估算器,用 Kaplan 縮放律由引數量與訓練 token 數估算總訓練 FLOPs,輔助算力規劃。
計算公式與原理
訓練 FLOPs ≈ 6·N·D(N 為引數量,D 為訓練 token 數);訓練月數 ≈ 6ND / (卡數 × 單卡算力 × 3600 × 24 × 30)
Transformer 訓練的經驗法則:前向 2N、反向約 4N,合計每 token 約 6N FLOPs,即 Chinchilla 系列縮放律推導的基礎。再除以叢集有效算力(須乘 MFU,實際常 30%–50%)得到訓練週期。
使用步驟
- 填寫「引數量(億)」。
- 填寫「訓練 tokens(億)」。
- 填寫「GPU 數」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- Kaplan 縮放律:訓練 FLOPs≈6·N·D,N 為引數量、D 為訓練 token 數。
- 前向約 2ND、反向約 4ND,合計 6ND;用於大模型算力與時間表規劃。
- 實際受並行效率、通訊與視訊記憶體限制,理論值需乘開銷係數。
算例參考
- 7B 模型算力:N=7×10⁹, D=1×10¹² → FLOPs≈6×7e9×1e12=4.2×10²²。按 1e15 FLOPs/s(約 1 PFLOPS 有效)需≈4.2e7 秒≈487 天單卡;實際靠千卡叢集並行縮短。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 6ND 是上限還是典型值?
- 6ND 是前向+反向的理論下界(理想乘加計數),實際含啟用重算、通訊與低效會更高;規劃時乘以 1.5~3 倍餘量更穩妥。
- 引數量和訓練資料哪個更耗算力?
- 二者線性相乘,等比例增。但現代訓練常'資料受限',即資料量不足以讓引數充分訓練,此時加資料比加引數更划算(直到 Chinchilla 最優點)。