开发一款开源爬虫框架系列(五):爬虫架构的一些新思路

   爬虫开源项目地址:http://git.oschina.net/coliza/MongooCrawler

以前的思路是由客户端完成所有的下载网页,解析等功能,服务器端负责从内存队列中拿到数据并将获取的对象输出存储层。现在发现一个很麻烦的问题,不同的网站需要定制不同的抓取策略,如果部署爬虫集群,那么假如我

要修改解析策略或存储策略,客户端或者服务器只能重写、编译、部署,而且服务端负责存储压力大很容易造成性能瓶颈

解决方法就是,客户端一样负责抓取和分析功能,不一样的是这个定义解析策略的对象通过RPC调用服务端的接获取,这样修改策略就不需要再动客户端。客户端同时负责调用数据层的接口存储数据,只不过负责存储的对象同

样通过RPC调用服务端的接口获取。


近期一直在写爬虫,看了很多别人设计的爬虫架构后,我大概梳理了一下主要的功能模块,其一是抓取主体,一般是多个内存队列存储url,不同的爬虫节点从队列中获取url进行爬取;其二是公共库,存储一些抓取需要用的帐号和代理ip;其三是监控报警;其四是抓取规则配置。


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值