scrapy爬虫框架

Scrapy爬虫框架解析

最新推荐文章于 2025-01-28 17:04:19 发布

原创最新推荐文章于 2025-01-28 17:04:19 发布 · 1.4k 阅读

0 ·

CC 4.0 BY-SA版权

网络爬虫专栏收录该内容

1 篇文章

订阅专栏

scrapy爬虫工作原理

scrapy框架组件说明

Item

Item：用于声明需要在页面上抓取的内容，每个内容为一个Field。Item、Field都实现了dict接口。
Field的作用是可以为每一个提取到的值定义任意的metadata。

parse函数

parse函数为在框架抓取完url默认的response回调函数（如果Request没有指定callback，则使用parse函数），也是爬虫处理逻辑开始的入口函数。在该函数中可以返回Request对象；Item对象；dict对象；或者它们的列表。

Downloader Middleware

默认的Middleware包括：
{
‘scrapy.contrib.downloadermiddleware.robotstxt.RobotsTxtMiddleware’: 100,
‘scrapy.contrib.downloadermiddleware.httpauth.HttpAuthMiddleware’: 300,
‘scrapy.contrib.downloadermiddleware.downloadtimeout.DownloadTimeoutMiddleware’: 350,
‘scrapy.contrib.downloadermiddleware.useragent.UserAgentMiddleware’: 400,
‘scrapy.contrib.downloadermiddleware.retry.RetryMiddleware’: 500,
‘scrapy.contrib.downloadermiddleware.defaultheaders.DefaultHeadersMiddleware’: 550,
‘scrapy.contrib.downloadermiddleware.redirect.MetaRefreshMiddleware’: 580,
‘scrapy.contrib.downloadermiddleware.httpcompression.HttpCompressionMiddleware’: 590,
‘scrapy.contrib.downloadermiddleware.redirect.RedirectMiddleware’: 600,
‘scrapy.contrib.downloadermiddleware.cookies.CookiesMiddleware’: 700,
‘scrapy.contrib.downloadermiddleware.httpproxy.HttpProxyMiddleware’: 750,
‘scrapy.contrib.downloadermiddleware.chunked.ChunkedTransferMiddleware’: 830,
‘scrapy.contrib.downloadermiddleware.stats.DownloaderStats’: 850,
‘scrapy.contrib.downloadermiddleware.httpcache.HttpCacheMiddleware’: 900,
}
如果想要取消某个Middleware，需要在DOWNLOADER_MIDDLEWARES将其值设为None