最近抖音张同学突然火了,两个月涨粉一千多万。
今天这篇文章,我抓取了张同学的视频的评论数据,想从文本分析的角度,挖掘一下大家对张同学感兴趣的点。
张同学 10.4号开始发视频,视频的点赞量一直很高,11.17 号的视频达到了顶峰,收获 250w 个赞,之后关注量也开启了暴涨。
所以挖掘 11.17 号视频的评论,更有助于我们达成目的。
1. 抓取数据
抖音出了 web 版,抓取数据方便了很多。
抓评论
滑到网页评论区,在浏览器网络请求里过滤包含comment
的请求,不断刷新评论就可以看到评论的接口。
有了接口,就可以写 Python 程序模拟请求,获取评论数据。
请求数据要设置一定间隔,避免过大请求,影响别人服务
抓取评论数据有两点需要注意:
-
有时候接口可能返回空数据,因此需要多试几次,一般过了人工滑动验证后的接口基本可用
-
不同页面之间的数据可能会重复,所以需要跳页请求
2. EDA
11.17 号的视频有 12w 条评论,我只抓取了 1w 多条。
text
列是评论。
先对数据做一些探索性的分析,之前介绍过几个EDA
工具,可以自动产出基础的数据统计和图表。
这次我用的是ProfileReport