utf8、unicode、gbk、iso-8859-1字符编码详解

原创已于 2022-07-28 19:37:16 修改 · 2.5k 阅读

2 ·

CC 4.0 BY-SA版权

文章标签：

#字符编码 #unicode

于 2022-07-28 19:37:02 首次发布

jar、ajax、jxls、easyexcel、javaee 专栏收录该内容

66 篇文章

订阅专栏

本文详细介绍了ISO-8859-1与扩展ASCII的关系，重点讨论了UTF-8、UTF-16和UTF-32三种Unicode字符集编码的特性，包括字节序、BOM和Java对UTF-16的使用。还提及了bigendian和littleendian概念以及它们在文件存储中的影响。

1、iso-8859-1
128个字符显然是不够用的，于是ISO组织在ASCII码基础上又制定了一系列标准用来扩展ASCII编码，它们是ISO-8859-1~ISO-8859-15，其中ISO-8859-1涵盖了大多数西欧语言字符，所以应用得最广泛。ISO-8859-1仍然是单字节编码，它总共能表示256个字符
2、UTF8、UTF16、UTF32
UTF8、UTF16、UTF32都是unicode字符集的字符编码
UTF8：存在单字节编码，兼容ASCII；当编码为一个字节，则设最高比特位为0；当编码超过一个字节，则需要几个字节，就在第一个字节从最高位开始令连续的几个比特位为1，之后的字节最高位为10。

UTF32：用固定长度的字节存储字符编码，不管Unicode字符编号需要几个字节，全部都用4个字节存储，直接存储Unicode编号。无需经过字符编号向字符编码的转换步骤，提高效率，用空间换时间。

UTF16：使用2或4个字节进行存储。对于Unicode编号范围在0~FFFF之间的字符，统一用两个字节存储，无需字符转换，直接存储Unicode编号。对于Unicode字符编号在10000-10FFFF之间的字符，UTF16用四个字节存储，简单说就是：将Unicode字符编号(3字节)分为两部分，高位部分（Unicode字符编号中占1.5个字节）用一个值介于 D800-DBFF （110110yy yyyyyyyy，y为0/1）之间的双字节存储，低位部分用一个值介于 DC00-DFFF （110111xx xxxxxxxx，x为0/1）的双字节存储。而介于D800-DFFF之间的编码在Unicode中是预留的，不安排字符，如果Unicode中有字符的编号是这之间的值，会引发冲突和歧义，很有可能一个不常见字符（存储为四个字节）最后被读成两个常见字符（存储为两个字节）。

3、UTF16的big endian和little endian
big endian 和little endian是CPU处理多字节数的不同方式。例如“汉”字的Unicode编码是6C49。那么写到文件里时，究竟是将6C写在前面，还是将49写在前面？如果将6C写在前面，就是big endian。还是将49写在前面，就是little endian。
“endian”这个词出自《格列佛游记》。小人国的内战就源于吃鸡蛋时是究竟从大头(Big-Endian)敲开还是从小头(Little-Endian)敲开，由此曾发生过六次叛乱，其中一个皇帝送了命，另一个丢了王位。
我们一般将endian翻译成“字节序”，将big endian和little endian称作“大尾”和“小尾”。

4、UTF的字节序和BOM
UTF -8以字节为编码单元，没有字节序的问题。UTF-16以两个字节为编码单元，在解释一个UTF-16文本前，首先要弄清楚每个编码单元的字节序。例如收到一个“奎”的Unicode编码是594E，“乙”的Unicode编码是4E59。如果我们收到UTF-16字节流“594E”，那么这是“奎”还是 “乙”？
Unicode规范中推荐的标记字节顺序的方法是BOM。BOM不是“Bill Of Material”的BOM表，而是Byte Order Mark。BOM是一个有点小聪明的想法：
在UCS 编码中有一个叫做"ZERO WIDTH NO-BREAK SPACE"的字符，它的编码是FEFF。而FFFE在UCS中是不存在的字符，所以不应该出现在实际传输中。UCS规范建议我们在传输字节流前，先传输字符"ZERO WIDTH NO-BREAK SPACE"。
这样如果接收者收到FEFF，就表明这个字节流是Big-Endian的；如果收到FFFE，就表明这个字节流是Little-Endian的。因此字符"ZERO WIDTH NO-BREAK SPACE"又被称作BOM。
UTF-8不需要BOM来表明字节顺序，但可以用BOM来表明编码方式。字符"ZERO WIDTH NO-BREAK SPACE"的UTF-8编码是 EF BB BF（读者可以用我们前面介绍的编码方法验证一下）。所以如果接收者收到以EF BB BF开头的字节流，就知道这是UTF-8编码了。
Windows就是使用BOM来标记文本文件的编码方式的。

5、java 的字符类型采用的Unicode 编码方案
ava采用UTF-16编码作为内码，也就是说在JVM内部，文本是用16位码元序列表示的，常用的文本就是字符(char)和字符串(String)字面常量的内容。而，UTF-16是Unicode字符集的一种编码方案。

Java字符和字符串存在于以下几个地方：

●　Java源码文件，*.java，可以是任意字符编码，如GBK，UTF-8

●　Class文件，*.class，采用的是一种改进的UTF-8编码(Modified UTF-8)

●　JVM，内存中使用UTF-16编码

Java编译器需要正确的读取源码，消除编码差异，然后编译成UTF-8编码的Class文件。比如javac，默认情况下它会取操作系统的编码，可以使用参数-encoding指定源码文件的字符编码。JVM加载Class文件，把其中的字符或字符串转成UTF-16编码序列。

参考地址：
UTF、Unicode、ASCII及中文编码
 java 编码类型_java字符类型采用什么编码方式