编码识别器

🔤 Charset Detector

Detect text character encoding and guess the most likely charset.

📐 工作原理与说明
依据字节序列特征推测文本的字符编码。
  • BOM:UTF-8 为 EF BB BF,UTF-16LE 为 FF FE,UTF-16BE 为 FE FF。
  • 合法性:UTF-8 的多字节序列有严格规则,出现非法序列即可排除 UTF-8。
  • 统计:对双字节编码(GBK/Big5/Shift-JIS)用字频与双字节分布做概率判断。
  • 局限:推测并非确定结论,短文本极易误判,需结合语言上下文人工确认。

📚 深度解析:编码识别器

💡 常见使用场景

识别乱码
输入 GBK 字节 `C4E3BAC3` → 识别为 GBK,解码得“你好”(而非 UTF-8 的乱码)。

❓ 常见问题(FAQ)

识别一定准吗?
短文本可能误判,建议结合语言与来源综合判断。
为什么有时判断不准?
因为短文本信息量不足:GBK 与 Big5 的字节区间大面积重叠,纯 ASCII 内容在几乎所有编码下都合法,UTF-8 与 Latin-1 也无 BOM 可区分。工具只能给出概率最高的猜测,可靠做法是结合语言先验(中文优先 GBK/UTF-8)与业务来源,或直接要求数据方声明编码。