UTF-8 位元組數 使用指南
輸入ASCII字元與多位元組字元(如中文、emoji)的數量,按UTF-8變長編碼規則估算文本佔用的位元組數,便於預估儲存與傳輸體積。
計算公式與原理
ASCII = 1 位元組拉丁/希臘等 = 2 位元組CJK 常用字 = 3 位元組Emoji = 4 位元組
輸入ASCII字元與多位元組字元(如中文、emoji)的數量,按UTF-8變長編碼規則估算文本佔用的位元組數,便於預估儲存與傳輸體積。
典型使用場景
- 儲存規劃:混合中英文文本按字元型別估算位元組體積。
- 傳輸預算:介面報文 UTF-8 編碼後的真實位元組長度。
- 資料庫欄位:為 VARCHAR 按位元組而非字元設寬度(如 MySQL utf8mb4)。
算例參考
- 示例:10 ASCII + 5 中文:10×1 + 5×3 = 25 位元組;若含 emoji 則為 4 位元組/個。
注意事項
本工具純前端執行,輸入內容不上傳伺服器;結果為按上述口徑得到的理論估算值。實際應用受裝置引數、測量條件與當地規範影響,請以裝置銘牌、檢測報告與現行標準為準,重大決策建議諮詢專業人士。
- UTF-8 為何變長?
- ASCII 1 位元組、常用漢字 3 位元組、部分符號/emoji 4 位元組,兼顧相容與節省。
- emoji 佔幾字節?
- 多為 4 位元組(utf8mb4),部分組合 emoji 更長。
- 與字元數區別?
- 字元數≠位元組數,UTF-8 下需按位元組算儲存/傳輸,避免截斷亂碼。