Token 用量估算 使用指南
Token 用量估算器,按中英文与代码比例估算文本 token 数,提示不同分词器差异,辅助大模型上下文与成本核算。
计算公式与原理
tokens ≈ 中文字数 / 1.5 + 英文词数 / 0.75 + 代码字符数
混合内容按三类分别折算:中文按字符、英文按词、代码按字符(切分最碎)。这是粗略预算工具,实际值随分词器与符号密度浮动 ±20%,用于判断是否接近上下文上限时应留出安全余量。
使用步骤
- 填写「中文字数」。
- 填写「英文词数」。
- 填写「代码片段 tokens」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 按中英文与代码比例估算文本 token 数,提示不同分词器差异。
- 中文约 1~2 字/token(因模型而异),英文约 4 字符/token,代码密度更高。
- 估算用于把控上下文窗口与 API 成本,精确值需对应模型分词器计数。
算例参考
- 中英混排估算:一段 500 中文字+200 英文词:中文≈500×1.5=750 token,英文≈200×1.3=260 token,合计≈1010 token。实际因模型分词不同会有偏差。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 为什么中文 token 数不固定?
- 不同模型对中文的子词切分不同(按字/按词/混合),同一段中文 token 数可差数倍;本估算仅给量级,精确需对应分词器。
- 代码为什么更费 token?
- 代码含大量符号、缩进与标识符,信息密度高、子词切分更碎,同等字符数常比自然语言消耗更多 token。