推理吞吐估算 使用指南

推理吞吐估算器,由生成 token 数与端到端时延估算大模型推理吞吐(tokens/s),辅助服务容量与并发规划。

计算公式与原理

吞吐 = tokens / 秒;单请求吞吐 = tokens / (秒 × 并发批量)

推理服务的核心指标:总吞吐衡量集群利用率,单请求吞吐才是用户感知的快慢。batching 能显著提升总吞吐但会拉长单请求延迟,在线服务通常需要在两者间按 SLO 折中。

使用步骤

  1. 填写「生成 tokens」。
  2. 填写「耗时 秒」。
  3. 填写「并发数」。
  4. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

为什么吞吐不随并发线性增长?
显存带宽与算力是共享瓶颈,多请求竞争 KV 缓存与计算单元,边际吞吐递减;需实测找到拐点再定并发上限。
首 token 延迟和吞吐冲突吗?
常冲突。大模型首 token 受预填充耗时影响,吞吐受解码并行影响;优化方向相反时按业务(对话要低延迟、批处理要高吞吐)取舍。
→ 打开推理吞吐估算工具