python requests网页爬取初探

最新推荐文章于 2022-05-10 10:10:16 发布

原创最新推荐文章于 2022-05-10 10:10:16 发布 · 275 阅读

0 ·

CC 4.0 BY-SA版权

Python 开发记录专栏收录该内容

9 篇文章

订阅专栏

Python开发中，为获取网页数据可使用网页爬虫模块，如requests、urllib2、beautifulsoup bs4模块，能减少重复性工作。软件开发中建议用脚本代替部分工作，专注业务。作者试用request模块实现下载网页财经年报功能，获取数据更便捷。

python开发过程中，有时候需要网页的数据，这时用到网页爬虫模块，减少重复性工作，python提供了requests 模块，urllib2模块，beautifulsoup bs4模块。

软件开发中能够用脚本代替的工作尽量用脚本代替，我们专注于业务本身就好。

今天试了一下request模块，Demo功能是下载网页财经的年报，代码如下：

import requests
import urllib

nb_url='http://file.finance.sina.com.cn/211.154.219.97:9494/MRGG/CNSESH_STOCK/2020/2020-3/2020-03-23/5955888.PDF' ##这个链接需要在网站爬取，我直接找copy过来的

down_res=requests.get(nb_url)
with open(r'E:\test.PDF',"wb") as code:
    code.write(down_res.content)

挺方便的，以后要什么数据，爬到链接就可以下载到本地了