Scrapy 和 scrapy-redis的区别
Scrapy 是一个通用的爬虫框架,但是不支持分布式,Scrapy-redis是为了更方便地实现Scrapy分布式爬取,而提供了一些以redis为基础的组件(仅有组件)。
pip install scrapy-redis
Scrapy-redis提供了下面四种组件(components):(四种组件意味着这四个模块都要做相应的修改)
SchedulerDuplication FilterItem PipelineBase Spider
scrapy-redis架构

如上图所⽰示,scrapy-redis在scrapy的架构上增加了redis,基于redis的特性拓展了如下组件:
Scheduler:
Scrapy改造了python本来的collection.deque(双向队列)形成了自己的Scrapy queue(<
本文详细介绍了如何使用scrapy-redis构建分布式爬虫,包括Scrapy与scrapy-redis的区别、安装Redis、配置文件修改、连接测试、Redis数据类型,以及实例项目中的dmoz、myspider_redis、mycrawler_redis的使用和设置,最后讨论了Redis在去重和内容存储中的应用。
订阅专栏 解锁全文
1057

被折叠的 条评论
为什么被折叠?



