训练算力需求 使用指南

训练算力需求估算器,用 Kaplan 缩放律由参数量与训练 token 数估算总训练 FLOPs,辅助算力规划。

计算公式与原理

训练 FLOPs ≈ 6·N·D(N 为参数量,D 为训练 token 数);训练月数 ≈ 6ND / (卡数 × 单卡算力 × 3600 × 24 × 30)

Transformer 训练的经验法则:前向 2N、反向约 4N,合计每 token 约 6N FLOPs,即 Chinchilla 系列缩放律推导的基础。再除以集群有效算力(须乘 MFU,实际常 30%–50%)得到训练周期。

使用步骤

  1. 填写「参数量(亿)」。
  2. 填写「训练 tokens(亿)」。
  3. 填写「GPU 数」。
  4. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

6ND 是上限还是典型值?
6ND 是前向+反向的理论下界(理想乘加计数),实际含激活重算、通信与低效会更高;规划时乘以 1.5~3 倍余量更稳妥。
参数量和训练数据哪个更耗算力?
二者线性相乘,等比例增。但现代训练常'数据受限',即数据量不足以让参数充分训练,此时加数据比加参数更划算(直到 Chinchilla 最优点)。
→ 打开训练算力需求工具