笔记-Python编码问题整理

最新推荐文章于 2024-09-24 15:15:36 发布

原创

最新推荐文章于 2024-09-24 15:15:36 发布 · 1.7k 阅读

10 ·

CC 4.0 BY-SA版权

文章标签：

#笔记 #python #开发语言

GB2312是中国规定的汉字编码，也可以说是简体中文的字符集编码

GBK 是 GB2312的扩展 ,除了兼容GB2312外，它还能显示繁体中文，还有日文的假名

cp936：中文本地系统是Windows中的cmd，默认codepage是CP936，cp936就是指系统里第936号编码格式，即GB2312的编码。

(当然有其它编码格式：cp950 繁体中文、cp932 日语、cp1250 中欧语言。。。)

Unicode是国际组织制定的可以容纳世界上所有文字和符号的字符编码方案。UTF-8、UTF-16、UTF-32都是将数字转换到程序数据的编码方案。

UTF-8 （8-bit Unicode Transformation Format）是最流行的一种对 Unicode 进行传播和存储的编码方式。它用不同的 bytes 来表示每一个代码点。ASCII 字符每个只需要用一个 byte ，与 ASCII 的编码是一样的。所以说 ASCII 是 UTF-8 的一个子集。

在开发Python程序的过程中，会涉及到三个方面的编码：

Python程序文件的编码
Python程序运行时环境（IDE）的编码
Python程序读取外部文件、网页的编码

![在这里插入图片描述](https://img-blog.csdnimg.cn/direct/9e6038acdafa4b24ad42f0ed70d0d6e5.png

Python程序文件的编码

例如：

Python2自带的IDE，当创建了一个文件保存的时候提示：
在这里插入图片描述

这是因为Python2编辑器默认的编码是ASCII，它是无法识别中文的，所以会弹出这样的提示。这也是我们在大多情况下写python2程序的时候习惯在程序的第一行加上：#coding=utf-8

其实，这里的编码文件是很容易解决的。

Python程序运行时环境（IDE）的编码

执行下面的一段程序。

#coding=utf-8
from selenium import webdriver

driver = webdriver.Firefox()
driver.get("http://www.baidu.com")

# 返回百度页面底部备案信息
text = driver.find_element_by_id("cp").text
print