Python爬虫, 哪些奇特的网站值得一爬! 谱时网爬虫实例

Python爬虫实践：谱时网热门图片直播抓取

最新推荐文章于 2024-10-01 16:02:03 发布

原创

最新推荐文章于 2024-10-01 16:02:03 发布 · 1.5k 阅读

·

0

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

#python #大数据 #编程语言 #数据挖掘 #pycharm

本文介绍了如何使用Python爬虫抓取谱时网热门图片直播页面的所有图片信息，分析了页面动态加载的机制，并提供了简单的代码实现。适合Python爬虫初学者学习。

在我们学习的过程中，打开一个网站就想抓一次数据，但是并不是所有的网站都可以用一种方式抓到数据的，有的是网页结构特殊，有的是json数据包不一样，慢慢的写一些自己在抓站过程中遇到的奇特的网站，分享思路和抓取方法给大家！

工具、目标

工具：pycharm、python3.6版本

库：requests库

目标：谱时网热门图片直播页面，所有的图片信息

说明：该网站有热门图片页面，里面有活动的相关照片，按活动将所有的图片信息写入txt文档（不下载图片，是为了不对服务器造成影响）！

目标分析

首先，如上图打开主页，其它的不用管，直接点击右上角，出现选项后，点击进入热门图片直播选项（注意：有的浏览器要缩放页面，才可以看到热门图片直播的选项），进入后页面如下所示

这里我是缩放到了30%，下方呢，就是一个个的活动图片直播的页面了。随便点开一个活动，我们看看页面

看页面的图片加载这么慢，应该是动态加载的，右键查看源代码，果不其然！

没有任何的图片信息，那么我们就需要用到浏览器的页面审查工具了！我这里用的是火狐浏览器，摁F12就可以打开，然后点击网络，清除内容，刷新页面

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。