ASCII码和ANSI码的区别

原创已于 2023-07-31 20:12:22 修改 · 1w 阅读

41 ·

CC 4.0 BY-SA版权

文章标签：

#信息与通信 #密码学 #计算机网络

于 2019-01-19 12:02:38 首次发布

基础专栏收录该内容

8 篇文章

订阅专栏

本文从ASCII码讲起，介绍了ANSI码如何为不同语言提供编码支持，但其局限性导致多语言环境下出现乱码问题。进而探讨了Unicode编码如何解决这一问题，以及UTF-8编码如何在保持ASCII兼容性的基础上，实现高效、全球化的字符编码。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

ASCII码
American Standard Code for Information Interchange，即“美国信息交换标准码”。ASCII码中，一个英文字母（不分大小写）占一个字节的空间。
在这里插入图片描述
ANSI码
ANSI编码是一种对ASCII码的拓展：ANSI编码用0x00–0x7f （即十进制下的0到127）范围的1 个字节来表示 1 个英文字符，超出一个字节的 0x80~0xFFFF 范围来表示其他语言的其他字符。
也就是说，ANSI码仅在前128（0-127）个与ASCII码相同，之后的字符全是某个国家语言的所有字符。
值得注意的是，两个字节最多可以存储的字符数目是2的16次方，即65536个字符，这对于一个语言的字符来说，绝对够了。
还有ANSI编码其实包括很多编码：中国制定了GB2312编码，用来把中文编进去另外，日本把日文编到Shift_JIS里，韩国把韩文编到Euc-kr里，各国有各国的标准。受制于当时的条件，不同语言之间的ANSI码之间不能互相转换，这就会导致在多语言混合的文本中会有乱码。
Unicode编码
为了解决不同国家ANSI编码的冲突问题，Unicode应运而生：如果全世界每一个符号都给予一个独一无二的编码，那么乱码问题就会消失。
Unicode标准也在不断发展，但最常用的是用两个字节表示一个字符,如果要用到非常偏僻的字符，就需要4个字节。现代操作系统和大多数编程语言都直接支持Unicode。
但是问题在于，原本可以用一个字节存储的英文字母在Unicode里面必须存两个字节（规则就是在原来英文字母对应ASCII码前面补0），这就产生了浪费。
那么有没有一种既能消除乱码，又能避免浪费的编码方式呢？答案就是UTF-8！
UTF-8编码
这是一种变长的编码方式：它可以使用1~4个字节表示一个符号，根据不同的符号而变化字节长度，当字符在ASCII码的范围时，就用一个字节表示，保留了ASCII字符一个字节的编码做为它的一部分，如此一来UTF-8编码也可以是为视为一种对ASCII码的拓展。
值得注意的是unicode编码中一个中文字符占2个字节，而UTF-8一个中文字符占3个字节。从unicode到uft-8并不是直接的对应，而是要过一些算法和规则来转换。
在计算机内存中，统一使用Unicode编码，当需要保存到硬盘或者需要传输的时候，就转换为UTF-8编码。用记事本编辑的时候，从文件读取的UTF-8字符被转换为Unicode字符到内存里，编辑完成后，保存的时候再把Unicode转换为UTF-8保存到文件。

参考：https://blog.youkuaiyun.com/xiangxianghehe/article/details/77574965
常用中文字符用utf-8编码占用3个字节（大约2万多字），但超大字符集中的更大多数汉字要占4个字节（在unicode编码体系中，U+20000开始有5万多汉字）。
GBK、GB2312收编的汉字占2个字节，严格地用iso8859-1无法表示汉字，只能转为问号。