Token 數量估算 使用指南
Token 數量估算器,根據文本長度估算大模型 token 數量,幫助使用者把控上下文視窗與 API 呼叫成本。
計算公式與原理
估算 token 數 = ⌈字元數 × 語言係數 / 重疊係數⌉;英文參考 = ⌈字元數 × 0.3 / 1.5⌉;成本 ≈ token 數 / 10⁶ × 單價
不同語言與分詞器的壓縮率差異很大:中文常約 1–1.5 字元/token,英文約 4 字元/token。此式為量級估算,精確計費必須呼叫對應模型的官方 tokenizer;程式碼與數字因切分更碎,實際 token 數常高於純文本估計。
使用步驟
- 填寫「字元數」。
- 填寫「語言係數 1=中文 0.3=英文」。
- 填寫「平均詞長」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 根據文本長度與語言比例估算大模型 token 數,幫助使用者把控上下文視窗。
- 中文約每 1~2 字 1 token,英文約每 4 字元 1 token,具體隨分詞器變化。
- 估算用於預判 API 呼叫成本與是否觸發上下文截斷。
算例參考
- 長度估算:一段 800 中文字的文本,按 1.5 字/token 估算≈533 token;若疊加 200 英文詞≈260 token,合計≈793 token,接近 1k 上下文佔用的 80%。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 估算和真實計費差多少?
- 量級基本一致,精確值取決於具體模型分詞器;中文差異可能被放大數倍,正式計費以廠商返回 token 數為準。
- 怎麼避免超出上下文?
- 先在本地估算文本 token,長文本做摘要或分塊,預留生成空間(通常留 20%~30%),避免觸發截斷導致資訊丟失。