一. 爬虫的方式:
主要有2种方式:
①Scrapy+Xpath (API 静态 爬取-直接post get)
②selenium+Xpath (点击 动态 爬取-模拟)
Scrapy+Xpath
XPath 是 Scrapy 中常用的一种解析器,可以帮助爬虫定位和提取 HTML 或 XML 文档中的数据。
Scrapy 中使用 XPath 的方式和普通的 Python 程序基本一致。我们需要首先导入 scrapy 的 Selector 类和 scrapy 的 Request 类,然后使用 Selector 类来解析 Response 对象,并使用 XPath 表达式来定位和提取数据。
详细讲解可以参考:Scrapy爬虫学习笔记之二(Xpath的用法) - 知乎
selenium+Xpath
Selenium 是为了解决 requests 无法直接执行 JavaScript 代码的问题。本质是通过驱动浏览器,完全模拟浏览器的操作,输入、点击、下拉等。
安装:pip install selenium
使用需要下载浏览器驱动,并且驱动要跟浏览器版本对应
chrome浏览器版本在114之前
浏览器版本在114之前,可以进入以下网址http://chromedriver.storage.googleapis.com/index.html,直接下载相应的文件
chrome浏览器版本在115以上
以下版本皆为chromedriver版本
例如:version : 119.0.6045.21,你电脑的浏览器版本为其他版本,如118.0.5952.2,只需要把链接中的版本号替换成这个编号即可