SimpleCrawler 开源项目教程-优快云博客

本文链接：https://blog.youkuaiyun.com/gitblog_00098/article/details/139315899

SimpleCrawler 开源项目教程

simplecrawler Flexible event driven crawler for node. 项目地址: https://gitcode.com/gh_mirrors/si/simplecrawler

1. 项目介绍

SimpleCrawler 是一个灵活且事件驱动的 Node.js 爬虫库，旨在为网站爬取提供一个基本、灵活且强大的 API。它适用于需要爬取大量网页并将其内容写入磁盘的场景。SimpleCrawler 能够自动检测链接资源，并提供了一个可配置的队列系统，支持将队列数据保存到磁盘并在需要时恢复。

2. 项目快速启动

安装

首先，通过 npm 安装 SimpleCrawler：

npm install --save simplecrawler

初始化

接下来，初始化 SimpleCrawler 并配置一些基本属性：

const Crawler = require("simplecrawler");
const crawler = new Crawler("http://www.example.com/");

// 设置请求间隔和并发数
crawler.interval = 10000; // 10秒
crawler.maxConcurrency = 3;

// 设置最大深度
crawler.maxDepth = 2; // 只爬取第一页及其链接

// 监听事件
crawler.on("fetchcomplete", function(queueItem, responseBuffer, response) {
    console.log("我刚刚收到了 %s (%d 字节)", queueItem.url, responseBuffer.length);
    console.log("它是一个 %s 类型的资源", response.headers['content-type']);
});

// 启动爬虫
crawler.start();