模型視訊記憶體估算 使用指南
按引數量、精度位元組數與啟用佔用估算模型權重與推理視訊記憶體,適用於部署硬體選型、批次大小設定與視訊記憶體溢位預警。
計算公式與原理
權重視訊記憶體 ≈ 引數量 × 每引數位元組數;總視訊記憶體 ≈ 權重 + 啟用/1000
推理視訊記憶體主要由權重決定:FP16 為 2 位元組、INT8 為 1 位元組、FP32 為 4 位元組。訓練還要加梯度與 Adam 狀態(各再佔 1 份與 2 份權重),加上隨批次與序列長度增長的啟用值,常是權重本身的數倍。
使用步驟
- 填寫「引數量(十億)」。
- 填寫「每引數位元組」。
- 填寫「啟用 MB」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 權重視訊記憶體≈引數量×每引數位元組數(FP16=2, INT8=1, FP32=4)。
- 推理視訊記憶體還需加啟用/KV 快取,訓練另需梯度與最佳化器狀態(常數倍於權重)。
- 估算用於硬體選型、batch 設定與視訊記憶體溢位預警。
算例參考
- 7B 模型視訊記憶體:7B 引數 FP16:權重≈7e9×2=14GB;加 KV 快取與啟用後推理約 16~18GB,可在 24GB 顯示卡跑;若訓則需額外梯度+最佳化器(約 3~4 倍權重)。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 為什麼訓練視訊記憶體遠大於推理?
- 訓練需保留前向啟用供反向、存梯度(同尺寸)與最佳化器狀態(Adam 約 2 倍權重),常使總視訊記憶體達權重 3~4 倍;推理只需權重+少量啟用。
- 視訊記憶體不夠怎麼辦?
- 量化降權重位元組數、用梯度檢查點換計算省啟用、降 batch、或模型並行/張量並行分片;必要時上更大視訊記憶體或分散式。