本次目的:
python 抓取某某站图片
本次亮点:
- 系统性分析页面
- 多页面数据解析
- 海量图片数据保存
开发环境 & 第三方模块:
- 解释器版本 >>> python 3.8
- 代码编辑器 >>> pycharm 2021.2
- requests >>> pip install requests
- parsel >>> pip install parsel
爬虫主要流程:
一. 网站分析
- 找到目标网站
链接 - 获取每个相册的地址 去批量的下载图片
二. 代码实现过程
- 发送网络请求 向相册列表页 链接
- 获取数据 网页源代码
- 筛选数据 相册地址
- 发送网络请求 向相册页面 并且 获取数据 网页源代码
- 筛选数据 图片地址
- 发送网络请求 & 获取数据 向图片地址
- 保存图片
代码编写
1. 导入模块
import requests
import parsel # lxml re bs4
import re
import os
2. 加一个伪装
headers = {
'referer': 'https://www.jdlingyu.com/tuji',
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/98.0.4758.102 Safari/537.36'