编码识别器 使用指南

输入 GBK 字节 「C4E3BAC3」 → 识别为 GBK,解码得“你好”(而非 UTF-8 的乱码)。

核心功能

适用场景

使用步骤

  1. 把出现乱码的文本原样粘贴进输入框
  2. 点识别查看候选编码与置信度
  3. 按最高置信度的编码重新解码文本,确认是否恢复正常
  4. 若候选里同时有 GBK 与 UTF-8,优先试 GBK——常见乱码多源于此
  5. 原文越短推断越不准,尽量粘贴完整片段

实用技巧

常见问题

识别一定准吗?
短文本可能误判,建议结合语言与来源综合判断。
为什么有时判断不准?
因为短文本信息量不足:GBK 与 Big5 的字节区间大面积重叠,纯 ASCII 内容在几乎所有编码下都合法,UTF-8 与 Latin-1 也无 BOM 可区分。工具只能给出概率最高的猜测,可靠做法是结合语言先验(中文优先 GBK/UTF-8)与业务来源,或直接要求数据方声明编码。
→ 去使用 编码识别器(免费 · 纯前端 · 数据不上传)