Token 用量估算 使用指南

Token 用量估算器,按中英文與程式碼比例估算文本 token 數,提示不同分詞器差異,輔助大模型上下文與成本核算。

計算公式與原理

tokens ≈ 中文字數 / 1.5 + 英文詞數 / 0.75 + 程式碼字元數

混合內容按三類分別折算:中文按字元、英文按詞、程式碼按字元(切分最碎)。這是粗略預算工具,實際值隨分詞器與符號密度浮動 ±20%,用於判斷是否接近上下文上限時應留出安全餘量。

使用步驟

  1. 填寫「中文字數」。
  2. 填寫「英文詞數」。
  3. 填寫「程式碼片段 tokens」。
  4. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

為什麼中文 token 數不固定?
不同模型對中文的子詞切分不同(按字/按詞/混合),同一段中文 token 數可差數倍;本估算僅給量級,精確需對應分詞器。
程式碼為什麼更費 token?
程式碼含大量符號、縮排與識別符號,資訊密度高、子詞切分更碎,同等字元數常比自然語言消耗更多 token。
→ 開啟Token 用量估算工具