Python -bs4反爬虫解决方法

最新推荐文章于 2024-11-07 00:03:13 发布

Co_zy

最新推荐文章于 2024-11-07 00:03:13 发布

阅读量1.9k

点赞数

CC 4.0 BY-SA版权

分类专栏： Python网络爬虫

本文链接：https://blog.youkuaiyun.com/Co_zy/article/details/77155186

Python网络爬虫专栏收录该内容

23 篇文章

订阅专栏

本文介绍了解决爬虫遇到的两大难题：IP封锁和禁止机器人爬取的方法。通过使用代理IP和伪造浏览器标识的方式绕过网站的限制，确保爬虫能够顺利抓取所需数据。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

爬虫有时会遭遇两种情况,导致无法正常爬取
(1)IP封锁,(貌似美团会出现)
(2)禁止机器人爬取,(比如Amazon)

解决方法:
我们以下面文章里的爬虫代码为例
http://blog.youkuaiyun.com/co_zy/article/details/77150544
其中的getHTMLText()函数,更改如下,添加fakeHeaders ,proxies
这里的可以通过ip测试网站进行验证是否成功使用了代理 http://ip.chinaz.com/

def getHTMLText(self,url):
        fakeHeaders = {'user-agent':'Mozilla/5.0'}
        proxies = { "http": "http://10.10.1.10:3128", "https": "http://10.10.1.10:1080", }   
        try:
            r = requests.get(url,headers = fakeHeaders , proxies=proxies,timeout=30)
            r.raise_for_status()
            r.encoding = r.apparent_encoding
            return r.text
        except:
            return ""