模型視訊記憶體估算 使用指南

按引數量、精度位元組數與啟用佔用估算模型權重與推理視訊記憶體,適用於部署硬體選型、批次大小設定與視訊記憶體溢位預警。

計算公式與原理

權重視訊記憶體 ≈ 引數量 × 每引數位元組數;總視訊記憶體 ≈ 權重 + 啟用/1000

推理視訊記憶體主要由權重決定:FP16 為 2 位元組、INT8 為 1 位元組、FP32 為 4 位元組。訓練還要加梯度與 Adam 狀態(各再佔 1 份與 2 份權重),加上隨批次與序列長度增長的啟用值,常是權重本身的數倍。

使用步驟

  1. 填寫「引數量(十億)」。
  2. 填寫「每引數位元組」。
  3. 填寫「啟用 MB」。
  4. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

為什麼訓練視訊記憶體遠大於推理?
訓練需保留前向啟用供反向、存梯度(同尺寸)與最佳化器狀態(Adam 約 2 倍權重),常使總視訊記憶體達權重 3~4 倍;推理只需權重+少量啟用。
視訊記憶體不夠怎麼辦?
量化降權重位元組數、用梯度檢查點換計算省啟用、降 batch、或模型並行/張量並行分片;必要時上更大視訊記憶體或分散式。
→ 開啟模型視訊記憶體估算工具