python实战！智能翻页批量下载文件

最新推荐文章于 2025-03-18 21:29:26 发布

原创

最新推荐文章于 2025-03-18 21:29:26 发布 · 476 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#python #java #xpath #大数据 #数据分析

本文介绍如何使用Python爬虫实现智能翻页批量下载文件，以京客隆为例，针对财务资料的PDF报告，通过解析网页获取文件名和链接，创建文件夹并逐个下载每个分类的文件。

python爬虫遇到爬取文件内容时，需要一页页的翻页爬取，这样很是麻烦，其实可以获取每个列表信息下的文件名和文件链接，让文件名和文件链接处理为列表，保存后下载，实现智能翻页批量下载文件，本文以以京客隆为例，批量下载文件，如财务资料，他的每一份报告都是一份pdf格式的文档。以此页面为目标，下载他每个分类的文件python爬虫实战之智能翻页批量下载文件。

1、引入库

import requests
import pandas as pd
from lxml import etree
import re
import os

2、解析初始页面

baseUrl ='http://www.jkl.com.cn/cn/invest.aspx'  # 爬取页面的数据 每日免费代理ip qq群：498181893
heade ={
   
   
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) 
Chrome/81.0.4044.92 Safari/537.36'
}


res =requests.get(url=baseUrl,headers=heade).text   
# print(res.text)
html = etree.HTML(res)
res =requests.get(url=baseUrl,headers=heade).text   #   设置变量接受 基础页的响应数据   
# print(res.text)每日免费代理ip qq群：498181893
html = etree.HTML(res)