CrawlScript语言轻松实现网络爬虫——轻松爬取整站信息

      CrawlScript语言在beta0.3版本中集成了整站爬虫的功能,只需要简单几句,就可以完成对整站的爬取。

      首先下载CrawlScript beta 0.3: CrawlScript beta 0.3版及demo下载

      下载后解压,在CrawlScript-bin文件夹中有一个demo.js,这个代码虽然只有几行,但是实现了对整个新华网的新闻正文的爬取和抽取,一个完整的网络爬虫。

      运行方式:用命令行进入CrawlScript-bin文件夹,输入命令:

java -jar crawlscript.jar demo.js

      爬虫的启动可能需要半分钟(这是因为这里的爬虫是允许在中断后继续爬取的,所以需要预处理很多信息)。然后就会发现不断刷新新信息。查看CrawlScript-bin下的download文件夹,会发现新华网的新闻在不断地加入:

     

      想了解更多,加入QQ讨论群或者发邮件咨询:

      CrawlScript爬虫脚本语言官方QQ群:250108697
      CrawlScript爬虫脚本语言官方邮箱:briefcopy@126.com
      注:CrawlScript是开源软件,不会向您索要任何费用。

       


一款可以复制别人开区网的软件,输入地址即可下载整个网源码程序,php asp 之类的动态程序无法下载。只能下载html htm 的静态页面文件! Teleport Ultra 所能做的,不仅仅是离线浏览某个网页,它可以从 Internet 的任何地方抓回你想要的任何文件。 它可以在你指定的时间自动登录到你指定的网下载你指定的内容,你还可以用它来创建某个网的完整的镜象,作为创建你自己的网的参考。 可以简单快速保存你所喜欢的网页,是仿制网的利器! 如果遇到屏蔽了浏览器保存网页,那么用网页整站下载器是一种很理想的办法。 使用网页整站下载器保存网页就简单多了,软件会自动保存所有的页面,但有时候由于软件功能过于强大,会导致很多不必要的代码、图片、js文件都一并保存到网页中 eleport Ultra 支持计划任务,定时到指定网下载指定的内容,经由其保存的网,保持源点了的 CSS 样式、脚本功能,超链接也都替换为本地链接以方便浏览。 Teleport Ultra 实际就是一个网络蜘蛛(网络机器人),自动从网络撷取特定的资料。使用它可以在本地创建完整的网镜像或副本,共有6种工作模式: 1) 在硬盘中创建一个可浏览的网副本; 2) 复制一个网,包括网的目录结构; 3) 在一个网中搜索指定的文件类型; 4) 从一个中心点探测每一个链接的点; 5) 在已知地址下载一个或多个文件; 6) 在一个网中搜索指定的关键字。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值