编码识别器
← ToolBox
/ 编码识别器
🌙
首页
‹
💻 开发
‹
编码识别器
📖 查看「编码识别器使用指南」
🔤 Charset Detector
Detect text character encoding and guess the most likely charset.
📐 工作原理与说明
依据字节序列特征推测文本的字符编码。
BOM
:UTF-8 为
EF BB BF
,UTF-16LE 为
FF FE
,UTF-16BE 为
FE FF
。
合法性
:UTF-8 的多字节序列有严格规则,出现非法序列即可排除 UTF-8。
统计
:对双字节编码(GBK/Big5/Shift-JIS)用字频与双字节分布做概率判断。
局限
:推测并非确定结论,短文本极易误判,需结合语言上下文人工确认。
粘贴异常文本
éäââëåè
识别并修复
复制修复结果
📚 深度解析:编码识别器
💡 常见使用场景
拿到一段不知编码的文本(GBK/UTF-8/Big5)时推断其字符集。
处理乱码文件:导入 CSV 前先探测编码,确认是 UTF-8、GBK 还是带 BOM 的 UTF-8,再按正确编码读取,避免整表出现问号或错字。
识别乱码
输入 GBK 字节 `C4E3BAC3` → 识别为 GBK,解码得“你好”(而非 UTF-8 的乱码)。
❓ 常见问题(FAQ)
识别一定准吗?
短文本可能误判,建议结合语言与来源综合判断。
为什么有时判断不准?
因为短文本信息量不足:GBK 与 Big5 的字节区间大面积重叠,纯 ASCII 内容在几乎所有编码下都合法,UTF-8 与 Latin-1 也无 BOM 可区分。工具只能给出概率最高的猜测,可靠做法是结合语言先验(中文优先 GBK/UTF-8)与业务来源,或直接要求数据方声明编码。