utf-8 中的一个汉字占几个字节

最新推荐文章于 2024-01-24 17:23:01 发布

原创最新推荐文章于 2024-01-24 17:23:01 发布 · 1.3w 阅读

·

4

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

network 专栏收录该内容

6 篇文章

订阅专栏

本文详细探讨了UTF-8编码下汉字所占用的字节数，揭示了不同范围内的汉字占用3个或4个字节的具体情况，并纠正了一些常见的误解。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

原文链接：http://blog.youkuaiyun.com/chummyhe89/article/details/7777613

占 2 个字节的：〇

占 3 个字节的：基本等同于 GBK，含 21000 多个汉字

占 4 个字节的：中日韩超大字符集里面的汉字，有 5 万多个

1 个 utf8 数字占 1 个字节

1 个 utf8 英文字母占 1 个字节

在查找 UTF-8 编码资料时发现，很多的帖子说的 UTF-8 编码里，一个汉字占用3个字节，

有的还做了个证明，大概是这样的，创建一个没有 BOM 的 UTF-8 编码的文本文件，

里面保存了几个汉字，然后查看文件的大小。我觉得这样的证明没有一点说服力，

因为 UTF-8 是变长的，1-6 个字节，少量的汉字检测不能说明所有的汉字都是的。

后来我又查看了字符映射表－汉语，找到了正确的答案：

少数是汉字每个占用 3 个字节，多数占用 4 个字节。

占用 3 个字节的范围

U+2E80 - U+2EF3 : 0xE2 0xBA 0x80 - 0xE2 0xBB 0xB3 共 115 个

U+2F00 - U+2FD5 : 0xE2 0xBC 0x80 - 0xE2 0xBF 0x95 共 213 个

U+3005 - U+3029 : 0xE3 0x80 0x85 - 0xE3 0x80 0xA9 共 36 个

U+3038 - U+4DB5 : 0xE3 0x80 0xB8 - 0xE4 0xB6 0xB5 共 7549 个

U+4E00 - U+FA6A : 0xE4 0xB8 0x80 - 0xEF 0xA9 0xAA 共 44138 个

U+FA70 - U+FAD9 : 0xEF 0xA9 0xB0 - 0xEF 0xAB 0x99 共 105 个

合计： 52156 个

占用 4 个字节的范围

U+20000 - U+2FA1D : 0xF0 0xA0 0x80 0x80 - 0xF0 0xAF 0xA8 0x9D 共 64029 个

合计： 64029 个

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。