Token 用量估算 使用指南
Token 用量估算器,按中英文與程式碼比例估算文本 token 數,提示不同分詞器差異,輔助大模型上下文與成本核算。
計算公式與原理
tokens ≈ 中文字數 / 1.5 + 英文詞數 / 0.75 + 程式碼字元數
混合內容按三類分別折算:中文按字元、英文按詞、程式碼按字元(切分最碎)。這是粗略預算工具,實際值隨分詞器與符號密度浮動 ±20%,用於判斷是否接近上下文上限時應留出安全餘量。
使用步驟
- 填寫「中文字數」。
- 填寫「英文詞數」。
- 填寫「程式碼片段 tokens」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 按中英文與程式碼比例估算文本 token 數,提示不同分詞器差異。
- 中文約 1~2 字/token(因模型而異),英文約 4 字元/token,程式碼密度更高。
- 估算用於把控上下文視窗與 API 成本,精確值需對應模型分詞器計數。
算例參考
- 中英混排估算:一段 500 中文字+200 英文詞:中文≈500×1.5=750 token,英文≈200×1.3=260 token,合計≈1010 token。實際因模型分詞不同會有偏差。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 為什麼中文 token 數不固定?
- 不同模型對中文的子詞切分不同(按字/按詞/混合),同一段中文 token 數可差數倍;本估算僅給量級,精確需對應分詞器。
- 程式碼為什麼更費 token?
- 程式碼含大量符號、縮排與識別符號,資訊密度高、子詞切分更碎,同等字元數常比自然語言消耗更多 token。