文章目录
在学习Scrapy前,我们需要先了解其架构和工作原理,这样才能很好的去使用Scrapy。
Scrapy的整体架构如下图所示,同时也标注出了其各个组件和数据流。
数据流
Scrapy的数据流由引擎控制,流程如下:
- 引擎Engine从爬虫Spiders中获得初始请求开始抓取。
- 引擎Engine在调度器Scheduler中调度请求,并准备对下一次的请求进行抓取。
- 调度器Scheduler返回下一个请求给引擎Engine。
- 引擎Engine通过下载器中间件Downloader Middleware发送请求到下载器Downloader
- 一旦下载器Downloader完成页面下载,将生成一个响应Response通过下载器中间件Downloader Middleware返回给引擎Engine。
- 引擎Engine收到下载器Downloader的响应,通过爬虫中间件Spiders Middleware发送给爬虫Spiders进行处理。
- 爬虫Spiders处理响应Response,并通过爬虫中间件Spiders Middleware返回处理后的Items,以及新的请求Request给引擎Engine。
- 引擎Engine发送处理后的Items给到项目管道Item Pipelines进行存储或其他处理,然后把处理后的请求Requests发送给调度器Scheduler,计划处理下一个可能抓取的请求。
- 流程从第3步重复,直到调度器Scheduler中没有更多的请求。
上面流程中提到了很多名词,比如引擎、调度器、下载器、爬虫、项目管道、中间件,这些是什么呢?都是Scrapy的组件。