Python爬虫入门教程，突破煎蛋网反爬措施，妹子图批量抓取！

最新推荐文章于 2022-12-13 10:31:33 发布

原创

最新推荐文章于 2022-12-13 10:31:33 发布 · 557 阅读

1 ·

CC 4.0 BY-SA版权

文章标签：

#python #java #selenium #数据分析 #web

本文介绍如何使用Python的Selenium库突破煎蛋网的反爬策略，抓取并下载妹子图。首先分析网站，通过PhantomJS模拟浏览器行为，接着编写get_content函数处理网页源码，最后实现图片的下载功能。

今天写一个爬虫爱好者特别喜欢的网站煎蛋网，这个网站其实还是有点意思的，网站很多人写了N多的教程了，各种方式的都有，当然网站本身在爬虫爱好者的不断进攻下，也在不断的完善，反爬措施也很多，今天我用 selenium 在揍他一波。

Python爬虫入门教程，突破煎蛋网反爬措施，妹子图批量抓取！

整体看上去，煎蛋网的妹子图质量还是可以的，不是很多，但是还蛮有味道的，这可能也是爬虫er，一批一批的奔赴上去的原因。

Python爬虫入门教程，突破煎蛋网反爬措施，妹子图批量抓取！

1. 网站分析

这个网站如果用 selenium 爬取，其实也没什么要分析的,模拟访问就行，导入必备的模块。

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from lxml import etree
import requests
import time
复制代码

我使用的是 PhantomJ