python数据分析实例：利用爬虫获取数据_爬虫爬取网站数据并分析

2401_89190931

于 2025-01-13 16:23:14 发布

阅读量1.7k

点赞数 27

文章标签： python 数据分析爬虫

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/2401_89190931/article/details/145118503

版权

现在很多网站都用Ajax（异步加载）的技术，打开网页，先给你看上面一部分东西，然后剩下的东西再慢慢加载。所以你可以看到很多网页，都是慢慢的刷出来的，或者有些网站随着你的移动，很多信息才慢慢加载出来。这样的网页有个好处，就是网页加载速度特别快。

但这个技术是不利于爬虫的爬取的，我们可以借助chrome浏览器的小工具进行分析，进入网络分析界面，界面如下：
在这里插入图片描述
这时候是一片空白，我们刷新一下，就可以看到一系列的网络请求了。

然后我们就开始找可疑的网页资源。首先，图片，css什么之类的可以跳过，一般来说，关注点放在xhr这种类型请求上，如下：

这类数据一般都会用json格式，我们也可以尝试在过滤器中输入json，来筛选寻找。
在这里插入图片描述

上图发现了两个xhr请求，从字面意思看很有可能是我们需要的信息，右键点击，在另一个界面打开。

我们可以在右边的框中，切换到“Preview”，然后点content——positionResult查看，能看到是关于职位的信息，以键值对的格式呈现，这就是json格式，特别适合网页数据交换。

第二步，网址构造

在“Headers”中，看到网页地址，通过观察网页地址可以发现推测出：http://www.lagou.com/jobs/positionAjax.json?这一段是固定的，剩下的我们发现有个city=%E5%8C%97%E4%BA%AC&needAddtionalResult=false&isSchoolJob=

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。