推理吞吐估算 使用指南
推理吞吐估算器,由生成 token 数与端到端时延估算大模型推理吞吐(tokens/s),辅助服务容量与并发规划。
计算公式与原理
吞吐 = tokens / 秒;单请求吞吐 = tokens / (秒 × 并发批量)
推理服务的核心指标:总吞吐衡量集群利用率,单请求吞吐才是用户感知的快慢。batching 能显著提升总吞吐但会拉长单请求延迟,在线服务通常需要在两者间按 SLO 折中。
使用步骤
- 填写「生成 tokens」。
- 填写「耗时 秒」。
- 填写「并发数」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 吞吐≈生成 token 数 / 端到端时延(tokens/s),衡量服务处理速度。
- 受模型大小、批大小、KV 缓存与硬件带宽共同影响,非仅由 FLOPs 决定。
- 容量规划用 吞吐×并发上限 估算峰值 QPS,需预留余量防雪崩。
算例参考
- 单请求吞吐:生成 200 token 耗时 4s → 吞吐=50 tokens/s。若单卡支持 4 并发且各 50 tok/s,总吞吐≈200 tok/s;但实际共享 KV 缓存与带宽,并发增益低于线性。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 为什么吞吐不随并发线性增长?
- 显存带宽与算力是共享瓶颈,多请求竞争 KV 缓存与计算单元,边际吞吐递减;需实测找到拐点再定并发上限。
- 首 token 延迟和吞吐冲突吗?
- 常冲突。大模型首 token 受预填充耗时影响,吞吐受解码并行影响;优化方向相反时按业务(对话要低延迟、批处理要高吞吐)取舍。