CrawlScript语言在beta0.3版本中集成了整站爬虫的功能,只需要简单几句,就可以完成对整站的爬取。
首先下载CrawlScript beta 0.3: CrawlScript beta 0.3版及demo下载。
下载后解压,在CrawlScript-bin文件夹中有一个demo.js,这个代码虽然只有几行,但是实现了对整个新华网的新闻正文的爬取和抽取,一个完整的网络爬虫。
运行方式:用命令行进入CrawlScript-bin文件夹,输入命令:
java -jar crawlscript.jar demo.js
爬虫的启动可能需要半分钟(这是因为这里的爬虫是允许在中断后继续爬取的,所以需要预处理很多信息)。然后就会发现不断刷新新信息。查看CrawlScript-bin下的download文件夹,会发现新华网的新闻在不断地加入:
想了解更多,加入QQ讨论群或者发邮件咨询:
CrawlScript爬虫脚本语言官方:250108697
CrawlScript爬虫脚本语言官方邮箱:briefcopy@126.com
注:CrawlScript是开源软件,不会向您索要任何费用。
CrawlScript beta0.3版本集成了整站爬虫功能,只需几行代码即可实现对新华网等网站新闻正文的爬取。下载并运行demo.js文件后,可在download文件夹查看爬取结果。

被折叠的 条评论
为什么被折叠?



