训练算力需求 使用指南
训练算力需求估算器,用 Kaplan 缩放律由参数量与训练 token 数估算总训练 FLOPs,辅助算力规划。
计算公式与原理
训练 FLOPs ≈ 6·N·D(N 为参数量,D 为训练 token 数);训练月数 ≈ 6ND / (卡数 × 单卡算力 × 3600 × 24 × 30)
Transformer 训练的经验法则:前向 2N、反向约 4N,合计每 token 约 6N FLOPs,即 Chinchilla 系列缩放律推导的基础。再除以集群有效算力(须乘 MFU,实际常 30%–50%)得到训练周期。
使用步骤
- 填写「参数量(亿)」。
- 填写「训练 tokens(亿)」。
- 填写「GPU 数」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- Kaplan 缩放律:训练 FLOPs≈6·N·D,N 为参数量、D 为训练 token 数。
- 前向约 2ND、反向约 4ND,合计 6ND;用于大模型算力与时间表规划。
- 实际受并行效率、通信与显存限制,理论值需乘开销系数。
算例参考
- 7B 模型算力:N=7×10⁹, D=1×10¹² → FLOPs≈6×7e9×1e12=4.2×10²²。按 1e15 FLOPs/s(约 1 PFLOPS 有效)需≈4.2e7 秒≈487 天单卡;实际靠千卡集群并行缩短。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 6ND 是上限还是典型值?
- 6ND 是前向+反向的理论下界(理想乘加计数),实际含激活重算、通信与低效会更高;规划时乘以 1.5~3 倍余量更稳妥。
- 参数量和训练数据哪个更耗算力?
- 二者线性相乘,等比例增。但现代训练常'数据受限',即数据量不足以让参数充分训练,此时加数据比加参数更划算(直到 Chinchilla 最优点)。