编码转换-优快云博客

今天太囧了，面试被问到一个编码的问题，原因是在简历里列了一个曾经写的 Unicode 转换的小程序，不过也是不知道多少年前的事情，全忘了，唉，不爽。

Unicode 编码，所有字符一律 2 个字节（有些特殊 4 个字节），它可以表示世界上任何一种符号，具有通用性，但是由于 ASCII 字符占 1 个字节，这就造成了 ASCII 字符的第一个字节总是 0 ，浪费了空间。在实际操作中，就对 Unicode 码进行编码，常用的方式就是 UTF-8。UTF-8 采用变长方式存储，长度 1-6 字节，一般情况下是 1，3 字节。这种做法是，英文字符占 1 个字节，汉字等占 3 个字节，由于英文作为世界语言，用的最广最多，所以就牺牲其他国家语言的表示方式了，没办法，谁叫它牛呢。

例子如下：

字符 'z'

ASCII 为 0x7f ，二进制 0111 1111

Unicode big endian 为 0x00 0x7f ，二进制为 0000 0000 0111 1111

UTF-8 为 0x7f ，二进制 0111 1111

字符 '我'

Unicode big endian 为 0x62 0x11，二进制为 0110 0010 0001 0001

UTF-8 为 0xe6 0x88 0x91 ，二进制 1110 0110 1000 1000 1001 0001

注意：红色的部分为 UTF-8 的固定部分，剩下的就是 Unicode big endian 的代码

可以做个试验：

打开记事本，输入汉字：“我”

以 ANSI 保存为 ansi.txt

以 Unicode 保存为 unicode.txt

以 Unicode big endian 保存为 unicode_b.txt

以 UTF-8 保存为 utf-8.txt

分别用WinHex或UltraEdit等工具以二进制文件打开，发现：

ansi.txt

CE D2 - 1100 1110 1101 0010

Unicode.txt

FF FE 11 62 - 1111 1111 1111 1110 0001 0001 0110 0010

unicode_b.txt

FE FF 62 11 - 1111 1110 1111 1111 0110 0010 0001 0001

utf-8.txt

EF BB BF E6 88 91 - 1110 1111 1011 1011 1011 1111 1110 0110 1000 1000 1001 0001

相信大家看出其中的玄机了：

对汉字而言，ANSI 其实就是 GBK。

在VC6中，

char *p="我";

循着 p 查看其内容为 CE D2

在Java中，

	String s = new String("我");
	try {
		byte[] b = s.getBytes();
		System.out.println(b[0] + 0);
		System.out.println(b[1] + 0);
	} catch (Exception e) {
		e.printStackTrace();
	}

结果输出
-50
-46
其实就是 CE D2