提示詞上下文視窗 使用指南
統計多輪對話的 token 佔用,計算其在模型上下文視窗中的佔比,輔助裁剪歷史與壓縮提示,適用於長對話管理、上下文溢位預警與成本估算。
計算公式與原理
已用 tokens = 系統提示 + 歷史 + 當前輸入;剩餘 = 上下文視窗 − 已用;佔用率 = 已用 / 視窗 × 100%
上下文視窗是硬性上限,輸入加輸出總和超限會被截斷或報錯。佔用超過 90% 時應壓縮歷史、摘要舊對話或改用更長上下文模型;注意輸出也要預留額度,不能把視窗填滿。
使用步驟
- 填寫「系統提示 token」。
- 填寫「歷史訊息 token」。
- 填寫「當前輸入 token」。
- 填寫「模型上下文視窗」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 上下文佔用=累計 token 數 / 模型上下文視窗長度(如 8k/32k/128k)。
- 多輪對話需扣除歷史 token,超出視窗須裁剪或摘要壓縮,否則被截斷。
- 佔用比越高越易觸發截斷與成本上升,長對話應定期清理低價值歷史。
算例參考
- 長對話溢位預警:視窗 32k,當前累計 28k token → 佔用 87.5%,剩餘 4k 僅夠約一句長回覆。若再追加 5k 歷史將溢位,應裁剪最早 6k 或用摘要替代原文。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 為什麼超出視窗會被截斷?
- 模型注意力只能覆蓋固定長度上下文,超出的字首會被丟棄(或報錯)。裁剪應保留最近對話與關鍵事實,避免丟失約束指令。
- 壓縮歷史會丟資訊嗎?
- 會。摘要壓縮以語義概括替代原文,可能損失細節;權衡做法是保留最近 N 輪原文、更早的做摘要,關鍵引數始終置頂。