梯度累积步数 使用指南

依据目标等效批次与单卡批次,计算梯度累积步数,适用于显存受限下的等效大批次训练配置与分布式策略设计。

计算公式与原理

累积步数 = ⌈目标批量 / (单卡批量 × 卡数)⌉

显存不够放大 batch 时,用小批量连续跑若干步再把梯度相加、只做一次参数更新,等效于大批量训练。注意归一化层统计与 BatchNorm 仍按小批量计算,与真正的大 batch 不完全等价;学习率要按等效批量同步放大。

使用步骤

  1. 填写「目标批次」。
  2. 填写「单卡批次」。
  3. 填写「GPU 数」。
  4. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

累积会影响收敛吗?
等效 batch 相同则统计近似一致,但累积使更新频率降低、训练更慢;学习率应按等效 batch 调整,而非单卡 batch。
累积步数设太大怎样?
等效 batch 过大易泛化变差、显存虽省但训练极慢;且 BN 统计仍按小 batch,与真实大 batch 有偏差,需同步调大 BN 动量或使用同步 BN。
→ 打开梯度累积步数工具