Python爬虫获取百度的图片

无尽的沉默

已于 2024-01-07 16:55:52 修改

阅读量4.8k

点赞数 22

分类专栏：深度学习文章标签： python 爬虫开发语言

于 2024-01-07 16:05:34 首次发布

本文链接：https://blog.youkuaiyun.com/hgnuxc_1993/article/details/135429737

版权

本文详细介绍了Scrapy结合XPath和selenium在网页爬取中的两种方式，包括Scrapy的API静态爬取和selenium的模拟点击动态爬取。重点讨论了如何使用Selenium获取百度图片并提供代码示例，以及icrawler库在批量爬取中的简化应用。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

一. 爬虫的方式：

主要有2种方式:

①Scrapy+Xpath (API 静态爬取-直接post get)

②selenium+Xpath (点击动态爬取-模拟)

XPath 是 Scrapy 中常用的一种解析器，可以帮助爬虫定位和提取 HTML 或 XML 文档中的数据。

Scrapy 中使用 XPath 的方式和普通的 Python 程序基本一致。我们需要首先导入 scrapy 的 Selector 类和 scrapy 的 Request 类，然后使用 Selector 类来解析 Response 对象，并使用 XPath 表达式来定位和提取数据。

Selenium 是为了解决 requests 无法直接执行 JavaScript 代码的问题。本质是通过驱动浏览器，完全模拟浏览器的操作，输入、点击、下拉等。

安装：pip install selenium

使用需要下载浏览器驱动，并且驱动要跟浏览器版本对应

chrome浏览器版本在114之前

浏览器版本在114之前，可以进入以下网址http://chromedriver.storage.googleapis.com/index.html，直接下载相应的文件

chrome浏览器版本在115以上

以下版本皆为chromedriver版本

例如：version : 119.0.6045.21，你电脑的浏览器版本为其他版本，如118.0.5952.2，只需要把链接中的版本号替换成这个编号即可

平台	下载地址
linux64	http:// https://edgedl.me.gvt1.com/edgedl/chrome/chrome-for-testing/119.0.6045.21/linux64/chromedriver-linux64.zip
mac-arm64	https://edgedl.me.gvt1.com/edgedl/chrome/chrome-for-testing/119.0.6045.21/mac-arm64/chromedriver-mac-arm64.zip
mac-x64	https://edgedl.me.gvt1.com/edgedl/chrome/chrome-for-testing/119.0.6045.21/mac-x64/chromedriver-mac-x64.zip
win32	https://edgedl.me.gvt1.com/edgedl/chrome/chrome-for-testing/119.0.6045.21/win32/chromedriver-win32.zip
win64	https://edgedl.me.gvt1.com/edgedl/chrome/chrome-for-testing/119.0.6045.21/w