mysql字符集 utf8 和utf8mb4 的区别

本文介绍了UTF8MB4字符集相较于UTF8的优势,特别是在处理4字节字符如Emoji表情方面的能力,并讨论了不同字符集在MySQL中的应用。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

可以简单的理解 utf8mb4 是目前最大的一个字符编码,支持任意文字.

为什么会有UTF8MB4?

既然utf8应付日常使用完全没有问题,那为什么还要使用utf8mb4呢? 低版本的MySQL支持的utf8编码,最大字符长度为 3 字节,如果遇到 4 字节的字符就会出现错误了。三个字节的 UTF-8 最大能编码的 Unicode 字符是 0xFFFF,也就是 Unicode 中的基本多文平面(BMP)。也就是说,任何不在基本多文平面的 Unicode字符,都无法使用MySQL原有的 utf8 字符集存储。这些不在BMP中的字符包括哪些呢?最常见的就是Emoji 表情(Emoji 是一种特殊的 Unicode 编码,常见于 ios 和 android 手机上),和一些不常用的汉字,以及任何新增的 Unicode 字符等等。

UTF-8编码

理论上将, UTF-8 格式使用一至六个字节,最大能编码 31 位字符。最新的 UTF-8 规范只使用一到四个字节,最大能编码21位,正好能够表示所有的 17个 Unicode 平面。关于UTF编码,请阅读《常见编码总结》一文。
而utf8 则是 Mysql 早期版本中支持的一种字符集,只支持最长三个字节的 UTF-8字符,也就是 Unicode 中的基本多文本平面。这可能是因为在MySQL发布初期,基本多文种平面之外的字符确实很少用到。而在MySQL5.5.3版本后,要在 Mysql 中保存 4 字节长度的 UTF-8 字符,就可以使用 utf8mb4 字符集了。例如可以用utf8mb4字符编码直接存储emoj表情,而不是存表情的替换字符。
为了获取更好的兼容性,应该总是使用 utf8mb4 而非 utf8,事实上,最新版的phpmyadmin默认字符集就是utf8mb4。诚然,对于 CHAR 类型数据,使用utf8mb4 存储会多消耗一些空间。

那么utf8mb4比utf8多了什么的呢?

多了emoji编码支持.

如果实际用途上来看,可以给要用到emoji的库或者说表,设置utf8mb4.

比如评论要支持emoji可以用到.

建议普通表使用utf8 如果这个表需要支持emoji就使用utf8mb4

新建mysql库或者表的时候还有一个排序规则

utf8_unicode_ci比较准确,utf8_general_ci速度比较快。通常情况下 utf8_general_ci的准确性就够我们用的了,在我看过很多程序源码后,发现它们大多数也用的是utf8_general_ci,所以新建数据 库时一般选用utf8_general_ci就可以了
如果是utf8mb4那么对应的就是 utf8mb4_general_ci utf8mb4_unicode_ci

### 字符集的基本定义 MySQL 中的字符集定义了数据库中存储字符的方式,其中 `utf8mb3` `utf8mb4` 是常见的字符集选项。`utf8mb3` 是一种简化版的 UTF-8 编码,最多使用 3 个字节来表示一个字符,适用于大部分拉丁字符常用汉字。而 `utf8mb4` 是完整的 UTF-8 编码,最多使用 4 个字节来表示一个字符,能够支持更广泛的字符集,包括生僻汉字、冷门符号 Emoji 表情符号[^3]。 ### 存储空间与性能影响 由于 `utf8mb3` 最多使用 3 个字节表示一个字符,因此在存储性能方面相对更高效。而 `utf8mb4` 使用最多 4 个字节表示一个字符,虽然能够支持更丰富的字符集,但也会占用更多的存储空间,并可能对性能产生轻微影响。这种差异在存储大量文本数据时尤为明显[^2]。 ### 支持的字符范围 `utf8mb4` 能够支持更多字符,包括生僻汉字、冷门符号 Emoji 表情符号,而 `utf8mb3` 无法表示这些字符。例如,某些 Emoji 表情符号在 `utf8mb3` 中无法正确显示,而 `utf8mb4` 则能够完整支持。因此,在需要处理现代互联网通信中广泛使用的表情符号时,`utf8mb4` 是更合适的选择。 ### 排序规则的区别 MySQL 中的排序规则(Collation)决定了字符集如何比较排序。常见的排序规则包括 `utf8mb4_general_ci`、`utf8mb4_unicode_ci`、`utf8mb4_bin` `utf8mb4_0900_ai_ci`。其中,`utf8mb4_general_ci` 是一种较旧的排序规则,适用于通用场景;`utf8mb4_unicode_ci` 基于 Unicode 标准,提供了更精确的排序比较;`utf8mb4_bin` 是二进制排序规则,区分大小写重音;而 `utf8mb4_0900_ai_ci` 是 MySQL 8.0 中引入的新排序规则,支持更现代的 Unicode 排序规则语言特定的排序[^1]。 ### 选择字符集的建议 在选择字符集时,应根据实际需求进行权衡。如果应用程序需要支持现代互联网通信中的丰富字符集,特别是 Emoji 表情符号,则应选择 `utf8mb4`。如果对存储空间性能有较高要求,且不需要支持复杂的字符集,则可以选择 `utf8mb3`。此外,选择合适的排序规则也是优化数据库性能功能的重要方面[^3]。 ```sql -- 查看当前数据库支持的字符集 SHOW CHARACTER SET; -- 查看当前数据库支持的排序规则 SHOW COLLATION; ``` ### 相关问题 1. MySQL中如何修改数据库、表列的字符集? 2. 什么是字符集排序规则在数据库中的作用? 3. 如何确保数据库中的字符集设置与应用程序一致? 4. 使用utf8mb4字符集时,如何优化存储空间性能? 5. MySQL中如何处理因字符集不匹配导致的乱码问题?
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值