
爬虫
文章平均质量分 57
「已注销」
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Gecco定时抓取慕课网实战课入门
Gecco定时抓取慕课网实战课入门 一、Gecco是什么 Gecco是一款用java语言开发的轻量化的易用的网络爬虫,不同于Nutch这样的面向搜索引擎的通用爬虫,Gecco是面向主题的爬虫。 通用爬虫一般关注三个主要的问题:下载、排序、索引。 主题爬虫一般关注的是:下载、内容抽取、灵活的业务逻辑处理。 Gecco的目标是提供一个完善的主题爬虫框架,简化下载和内容抽取的开发,利用管道过滤器模式,提供灵活的内容清洗和持久化处理模式,让开发人员把更多的精力投入到与业务主题相关的内容处理上。 主要特征 简单原创 2021-01-31 21:20:02 · 532 阅读 · 2 评论 -
com.gargoylesoftware.htmlunit.FailingHttpStatusCodeException: 404 Not Found 错误解决
错误详情: com.gargoylesoftware.htmlunit.FailingHttpStatusCodeException: 404 Not Found 解决办法 webClient.getOptions().setThrowExceptionOnFailingStatusCode(false);原创 2019-09-15 10:31:12 · 3016 阅读 · 0 评论 -
org.openqa.selenium.WebDriverException: unknown error: cannot find Chrome binary 异常解决
在通过Java使用Selenium自动化测试框架时遇到了org.openqa.selenium.WebDriverException: unknown error: cannot find Chrome binary 这个错误 原因猜测: 可能跟我安装的绿色版Chrome有关 解决方案一: 把chromedriver放到Chrome所在的根目录下即可 解决方案二: ChromeOptions op...原创 2019-09-22 22:58:00 · 10189 阅读 · 1 评论