置顶 “前嗅大数据”
和数据大牛一起成长,做牛气哄哄的大数据人
【场景描述】采集带有翻页的网页中的数据。
【使用工具】前嗅ForeSpider数据采集系统,免费下载:
【教程说明】
采集带有翻页的网站,需要先获取所有的翻页链接,常见的翻页链接有三种:数字翻页、点击加载更多/下一页、瀑布流翻页。接下来将为大家介绍不同翻页的配置方法。
1. 数字翻页
下图所示为一个典型的数字翻页:
开始配置前,先新建一个任务模板:
抽取翻页链接方法有三种:
①智能过滤法:
打开前几个翻页链接,观察链接规律,
第二页:文学_线装古籍_孔夫子旧书网
第三页:文学_线装古籍_孔夫子旧书网
第四页:文学_线装古籍_孔夫子旧书网
打开智能过滤界面: