推理吞吐估算

🔮 Inference Throughput Estimator

Estimate inference throughput in tokens per second from the generated token count and end-to-end latency, for capacity planning.

📐 计算公式 / 原理
吞吐 = tokens / 秒;单请求吞吐 = tokens / (秒 × 并发批量)
推理服务的核心指标:总吞吐衡量集群利用率,单请求吞吐才是用户感知的快慢。batching 能显著提升总吞吐但会拉长单请求延迟,在线服务通常需要在两者间按 SLO 折中。

📐 计算公式与说明

吞吐 = tokens / 耗时;人均 = 吞吐 / 并发

实际受批大小与排队影响。

📚 深度解析:推理吞吐估算

💡 常见使用场景

单请求吞吐
生成 200 token 耗时 4s → 吞吐=50 tokens/s。若单卡支持 4 并发且各 50 tok/s,总吞吐≈200 tok/s;但实际共享 KV 缓存与带宽,并发增益低于线性。

❓ 常见问题(FAQ)

为什么吞吐不随并发线性增长?
显存带宽与算力是共享瓶颈,多请求竞争 KV 缓存与计算单元,边际吞吐递减;需实测找到拐点再定并发上限。
首 token 延迟和吞吐冲突吗?
常冲突。大模型首 token 受预填充耗时影响,吞吐受解码并行影响;优化方向相反时按业务(对话要低延迟、批处理要高吞吐)取舍。