今天写一个爬虫爱好者特别喜欢的网站煎蛋网 ,这个网站其实还是有点意思的,网站很多人写了N多的教程了,各种方式的都有,当然网站本身在爬虫爱好者的不断进攻下,也在不断的完善,反爬措施也很多,今天我用 selenium 在揍他一波。


整体看上去,煎蛋网的妹子图质量还是可以的,不是很多,但是还蛮有味道的,这可能也是爬虫er,一批一批的奔赴上去的原因。

1. 网站分析
这个网站如果用 selenium 爬取,其实也没什么要分析的,模拟访问就行,导入必备的模块。
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from lxml import etree import requests import time 复制代码
我使用的是 PhantomJ

本文介绍如何使用Python的Selenium库突破煎蛋网的反爬策略,抓取并下载妹子图。首先分析网站,通过PhantomJS模拟浏览器行为,接着编写get_content函数处理网页源码,最后实现图片的下载功能。
最低0.47元/天 解锁文章
1257

被折叠的 条评论
为什么被折叠?



