編碼識別器 使用指南
輸入 GBK 位元組 「C4E3BAC3」 → 識別為 GBK,解碼得“你好”(而非 UTF-8 的亂碼)。
核心功能
- 對亂碼文本推測原始編碼
- 貼上異常文本即可得到候選編碼與置信度
- 用於排查 GBK / UTF-8 混用導致的亂碼
- 純本地推斷,文本不上傳
適用場景
- 拿到一段不知編碼的文本(GBK/UTF-8/Big5)時推斷其字元集。
- 處理亂碼檔案:匯入 CSV 前先探測編碼,確認是 UTF-8、GBK 還是帶 BOM 的 UTF-8,再按正確編碼讀取,避免整表出現問號或錯字。
使用步驟
- 把出現亂碼的文本原樣貼上進輸入框
- 點識別檢視候選編碼與置信度
- 按最高置信度的編碼重新解碼文本,確認是否恢復正常
- 若候選裡同時有 GBK 與 UTF-8,優先試 GBK——常見亂碼多源於此
- 原文越短推斷越不準,儘量貼上完整片段
實用技巧
- 短文本可能誤判,建議結合語言與來源綜合判斷
- 處理亂碼檔案:匯入 CSV 前先探測編碼,確認是 UTF-8、GBK 還是帶 BOM 的 UTF-8,再按正確編碼讀取,避免整表出現問號或錯字。
常見問題
- 識別一定準嗎?
- 短文本可能誤判,建議結合語言與來源綜合判斷。
- 為什麼有時判斷不準?
- 因為短文本資訊量不足:GBK 與 Big5 的位元組區間大面積重疊,純 ASCII 內容在幾乎所有編碼下都合法,UTF-8 與 Latin-1 也無 BOM 可區分。工具只能給出機率最高的猜測,可靠做法是結合語言先驗(中文優先 GBK/UTF-8)與業務來源,或直接要求資料方宣告編碼。