Grub-分布式Web爬虫

文章介绍了Grub,它是一个分布式应用程序,目标是追踪全球网站并提供实时网络地图。由Looksmart公司资助,用户可下载Windows或Linux版客户端工具,用空闲资源为构建最大最灵敏的URL信息数据库出力,还能查看用户统计信息。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

Grub 非彼 GRUB (GNU GRUB)。今天看到卢亮的 Larbin 一种高效的搜索引擎爬虫工具 一文提到 Nutch,Google 找了一下,发现了这个 Grub。此 Grub 是个分布式应用程序(类似 SETI@home ,寻找地外智能生物),该软件的目标有些惊人:

track down every site in the world and provide a real-time map of the Web

Grub 的资助者是 Looksmart 公司。如果感兴趣,可以下载客户端工具,用空闲的 CPU 资源与网络带宽为 Web 搜索添加一份自己的力量,共同构建世界上最大的最灵敏(?)的 URL 信息数据库。客户端工具目前有 Windows 版本和 Linux 版本,最新的版本号是 2.5 。

该工具的界面一瞥:

Grub.Distributed Web Crawling.png

在这里可以查看一些用户统计信息,可以看到排名第一的用户已经贡献了768,071,848 个 URL (to Dec-24-2004)。

Google+
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值