Token 用量估算 使用指南

Token 用量估算器,按中英文与代码比例估算文本 token 数,提示不同分词器差异,辅助大模型上下文与成本核算。

计算公式与原理

tokens ≈ 中文字数 / 1.5 + 英文词数 / 0.75 + 代码字符数

混合内容按三类分别折算:中文按字符、英文按词、代码按字符(切分最碎)。这是粗略预算工具,实际值随分词器与符号密度浮动 ±20%,用于判断是否接近上下文上限时应留出安全余量。

使用步骤

  1. 填写「中文字数」。
  2. 填写「英文词数」。
  3. 填写「代码片段 tokens」。
  4. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

为什么中文 token 数不固定?
不同模型对中文的子词切分不同(按字/按词/混合),同一段中文 token 数可差数倍;本估算仅给量级,精确需对应分词器。
代码为什么更费 token?
代码含大量符号、缩进与标识符,信息密度高、子词切分更碎,同等字符数常比自然语言消耗更多 token。
→ 打开Token 用量估算工具