Htime0305-优快云博客

转载爬虫（四）Selenium + Headless Chrome爬取Bing图片搜索结果

Bing图片搜索结果是动态加载的，如果我们直接用requests去访问页面爬取数据，那我们只能拿到很少的图片。所以我们使用Selenium + Headless Chrome来爬取搜索结果。在开始前，需要介绍一下xpath。XPathXPath即为XML路径语言（XML Path Language），它是一种用来确定XML文档中某部分位置的语言。使用它让我们可以很方便地定位页面中...

2019-09-26 19:55:00 470

转载爬虫（三）通过Selenium + Headless Chrome爬取动态网页

一、SeleniumSelenium是一个用于Web应用程序测试的工具，它可以在各种浏览器中运行，包括Chrome，Safari，Firefox 等主流界面式浏览器。我们可以直接用pip install selenium来进行安装。中文翻译文档：https://selenium-python-zh.readthedocs.io/en/latest/index.ht...

2019-09-20 10:51:00 1258

转载 python多线程建立代理ip池

之前有写过用单线程建立代理ip池，但是大家很快就会发现，用单线程来一个个测试代理ip实在是太慢了，跑一次要很久才能结束，完全无法忍受。所以这篇文章就是换用多线程来建立ip池，会比用单线程快很多。之所以用多线程而不是多进程，是因为测试时间主要是花费在等待网络传递数据上，处理本地计算的时间很短，用多线程能更好地发挥单核性能，而且多线程开销比多进程开销小得多。当然，单核性能会有极限，如果想再提...

2019-09-15 16:36:00 374

转载爬虫（二）建立代理ip池

之前我们说网站反爬虫的一个常用方法是检测ip，限制访问频率。所以我们要通过设置代理ip的办法绕过这个限制。有不少提供免费代理ip的网站，像https://www.xicidaili.com/nt/，我们可以从网站上拿到很多代理ip。但是这些ip并不是每个都能用的，或者说，没几个能用的。我们可以用beautifulsoup分析网页，然后处理，提取代理ip列表，也可以用正则表达式进...

2019-09-13 16:31:00 125

转载爬虫（一）反爬虫机制

爬虫用久了，总是会被封的。——鲁迅有些网站，特别是一些陈年老站，没有做过反爬虫机制的，我们可以尽情地爬，愉快地爬，把它们的底裤。。数据全都爬下来。最多出于情怀考虑，我们爬慢一点，不给它的服务器太大压力。但是对于有反爬虫机制的网站，我们不能这样。U-A校验最简单的反爬虫机制应该是U-A校验了。浏览器在发送请求的时候，会附带一部分浏览器及当前系统环境的参数给服务...

2019-09-13 09:55:00 541

转载 Python爬取b站任意up主所有视频弹幕

爬取b站弹幕并不困难。要得到up主所有视频弹幕，我们首先进入up主视频页面，即https://space.bilibili.com/id号/video这个页面。按F12打开开发者菜单，刷新一下，在network的xhr文件中有一个getSubmitVideo文件，这个文件里就有我们需要的视频av号了。如果直接抓取页面是拿不到的，因为视频是异步加载的。在这个文件里的data标签下...

2019-09-12 21:24:00 1493

Htime0305的博客

转载爬虫（四）Selenium + Headless Chrome爬取Bing图片搜索结果

转载爬虫（三）通过Selenium + Headless Chrome爬取动态网页

转载 python多线程建立代理ip池

转载爬虫（二）建立代理ip池

转载爬虫（一）反爬虫机制

转载 Python爬取b站任意up主所有视频弹幕

空空如也

空空如也

转载 爬虫（四）Selenium + Headless Chrome爬取Bing图片搜索结果

转载 爬虫（三）通过Selenium + Headless Chrome爬取动态网页

转载 python多线程建立代理ip池

转载 爬虫（二）建立代理ip池

转载 爬虫（一）反爬虫机制

转载 Python爬取b站任意up主所有视频弹幕

空空如也

空空如也

转载爬虫（四）Selenium + Headless Chrome爬取Bing图片搜索结果

转载爬虫（三）通过Selenium + Headless Chrome爬取动态网页

转载爬虫（二）建立代理ip池

转载爬虫（一）反爬虫机制