【转】python使用urllib2抓取网页

最新推荐文章于 2025-02-01 20:33:44 发布

转载最新推荐文章于 2025-02-01 20:33:44 发布 · 82 阅读

·

0

·

CC 4.0 BY-SA版权

原文链接：http://www.cnblogs.com/sunada2005/archive/2013/05/25/3099168.html

文章标签：

#python #爬虫 #操作系统

本文介绍如何使用Python的urllib2库进行网页爬取，并通过添加请求头信息来规避某些网站的爬虫限制。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

1、使用python的库urllib2，用到urlopen和Request方法。

2、方法urlopen原形

urllib2.urlopen(url[, data][, timeout])

其中：

url表示目标网页地址，可以是字符串，也可以是请求对象Request

data表示post方式提交给目标服务器的参数

timeout表示超时时间设置

改方法返回一个类似文件的对象，有geturl()、info()、read()方法其中geturl()返回连接地址，info()返回网页信息。

要获取网页内容可以使用read()方法，read也可以带参数，表示读取内容的大小（字节）。

>>> import urllib2
>>> socket = urllib2.urlopen("http://www.baidu.com")
>>> content = socket.read()
>>> socket.close()

这样，网页的内容（content）就爬下来了，但是有些网站禁止爬虫，如果直接请求会出现以下错误：

urllib2.HTTPError: HTTP Error 403: Forbidden

解决方法是可以在请求加上头信息，伪装成浏览器的访问行为，需要用到Request方法：

3、方法Request原型

urllib2.Request(url[, data][, headers][, origin_req_host][, unverifiable])

其中：

url表示目标网页地址，可以是字符串，也可以是请求对象Request

data表示post方式提交给目标服务器的参数

headers表示用户标识，是一个字典类型的数据，有些不允许脚本的抓取，所以需要用户代理，像火狐浏览器的代理就是类似：Mozilla/5.0 (X11; U; Linux i686)Gecko/20071127 Firefox/2.0.0.11 浏览器的标准UA格式为：浏览器标识 (操作系统标识; 加密等级标识; 浏览器语言) 渲染引擎标识版本信息，headers默认是Python-urllib/2.6

origin_req_host表示请求方的主机域名或者ip地址

unverifiable还没搞懂。。。

看一个例子：

>>> headers = {'User-Agent':'Mozilla/5.0 (X11; U; Linux i686)Gecko/20071127 Firefox/2.0.0.11'}
>>> req = urllib2.Request(url="http://blog.youkuaiyun.com/deqingguo",headers=headers)
>>> socket = urllib2.urlopen(req)
>>> content = socket.read()
>>> socket.close()

转载于:https://www.cnblogs.com/sunada2005/archive/2013/05/25/3099168.html

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。