编码识别器 使用指南
输入 GBK 字节 「C4E3BAC3」 → 识别为 GBK,解码得“你好”(而非 UTF-8 的乱码)。
核心功能
- 对乱码文本推测原始编码
- 粘贴异常文本即可得到候选编码与置信度
- 用于排查 GBK / UTF-8 混用导致的乱码
- 纯本地推断,文本不上传
适用场景
- 拿到一段不知编码的文本(GBK/UTF-8/Big5)时推断其字符集。
- 处理乱码文件:导入 CSV 前先探测编码,确认是 UTF-8、GBK 还是带 BOM 的 UTF-8,再按正确编码读取,避免整表出现问号或错字。
使用步骤
- 把出现乱码的文本原样粘贴进输入框
- 点识别查看候选编码与置信度
- 按最高置信度的编码重新解码文本,确认是否恢复正常
- 若候选里同时有 GBK 与 UTF-8,优先试 GBK——常见乱码多源于此
- 原文越短推断越不准,尽量粘贴完整片段
实用技巧
- 短文本可能误判,建议结合语言与来源综合判断
- 处理乱码文件:导入 CSV 前先探测编码,确认是 UTF-8、GBK 还是带 BOM 的 UTF-8,再按正确编码读取,避免整表出现问号或错字。
常见问题
- 识别一定准吗?
- 短文本可能误判,建议结合语言与来源综合判断。
- 为什么有时判断不准?
- 因为短文本信息量不足:GBK 与 Big5 的字节区间大面积重叠,纯 ASCII 内容在几乎所有编码下都合法,UTF-8 与 Latin-1 也无 BOM 可区分。工具只能给出概率最高的猜测,可靠做法是结合语言先验(中文优先 GBK/UTF-8)与业务来源,或直接要求数据方声明编码。