提示詞上下文視窗 使用指南

統計多輪對話的 token 佔用,計算其在模型上下文視窗中的佔比,輔助裁剪歷史與壓縮提示,適用於長對話管理、上下文溢位預警與成本估算。

計算公式與原理

已用 tokens = 系統提示 + 歷史 + 當前輸入;剩餘 = 上下文視窗 − 已用;佔用率 = 已用 / 視窗 × 100%

上下文視窗是硬性上限,輸入加輸出總和超限會被截斷或報錯。佔用超過 90% 時應壓縮歷史、摘要舊對話或改用更長上下文模型;注意輸出也要預留額度,不能把視窗填滿。

使用步驟

  1. 填寫「系統提示 token」。
  2. 填寫「歷史訊息 token」。
  3. 填寫「當前輸入 token」。
  4. 填寫「模型上下文視窗」。
  5. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

為什麼超出視窗會被截斷?
模型注意力只能覆蓋固定長度上下文,超出的字首會被丟棄(或報錯)。裁剪應保留最近對話與關鍵事實,避免丟失約束指令。
壓縮歷史會丟資訊嗎?
會。摘要壓縮以語義概括替代原文,可能損失細節;權衡做法是保留最近 N 輪原文、更早的做摘要,關鍵引數始終置頂。
→ 開啟提示詞上下文視窗工具