开发一款开源爬虫框架系列（五）：爬虫架构的一些新思路

最新推荐文章于 2025-11-01 09:22:14 发布

原创最新推荐文章于 2025-11-01 09:22:14 发布 · 3.1k 阅读

·

1

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

#JAVA #分布式应用 #scrapy #爬虫 #架构

搜索专栏收录该内容

9 篇文章

订阅专栏

爬虫开源项目地址：http://git.oschina.net/coliza/MongooCrawler

以前的思路是由客户端完成所有的下载网页，解析等功能，服务器端负责从内存队列中拿到数据并将获取的对象输出到存储层。现在发现一个很麻烦的问题，不同的网站需要定制不同的抓取策略，如果部署爬虫集群，那么假如我

要修改解析策略或存储策略，客户端或者服务器只能重写、编译、部署，而且服务端负责存储压力大很容易造成性能瓶颈。

解决方法就是，客户端一样负责抓取和分析功能，不一样的是这个定义解析策略的对象通过RPC调用服务端的接口获取，这样修改策略就不需要再动客户端。客户端同时负责调用数据层的接口存储数据，只不过负责存储的对象同

样通过RPC调用服务端的接口获取。

近期一直在写爬虫，看了很多别人设计的爬虫架构后，我大概梳理了一下主要的功能模块，其一是抓取主体，一般是多个内存队列存储url，不同的爬虫节点从队列中获取url进行爬取；其二是公共库，存储一些抓取需要用的帐号和代理ip；其三是监控报警；其四是抓取规则配置。

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。