上下文窗口占用 使用指南

統計提示詞與生成回覆的 token 數,計算其對模型上下文視窗的佔用比例,適用於長文本處理、上下文截斷預警與計費估算。

計算公式與原理

佔用率 = (系統提示 + 使用者輸入 + 預期回覆) / 上下文視窗 × 100%;剩餘 = 視窗 − 已用

規劃對話時把預期回覆長度一併計入,避免生成到一半撞上視窗上限被截斷。長視窗模型雖標稱很大,但注意力成本隨長度平方增長,且中段內容容易被忽略(lost-in-the-middle),並非越長越好。

使用步驟

  1. 填寫「系統提示 tokens」。
  2. 填寫「對話 tokens」。
  3. 填寫「回覆 tokens」。
  4. 填寫「上下文上限」。
  5. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

為什麼顯示佔用滿了卻還能聊?
部分實現會滾動丟棄最早歷史以維持視窗,表現為'能繼續但忘了開頭';嚴格實現則直接報錯。佔用比應預留生成餘量。
不同模型 token 數一樣嗎?
不同。同一段中文在 GPT/Claude/國產模型下 token 數差異明顯,估算僅供參考,精確值需對應分詞器計數。
→ 開啟上下文窗口占用工具