如何用websocket抓取JS渲染页面

本文探讨了使用WebSocket抓取JavaScript渲染页面的两种方法:一是借助Selenium等工具完成渲染后的抓取;二是直接模拟AJAX请求抓取数据。文中对比了这两种方法的优劣,并给出了大致的工作流程。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

上次面试,面试官问了下如何使用websocket抓取js渲染了的页面,因为原来抓取小说网站上的首页面都是静态网页,还没考虑过js渲染页面,后来看了看,发现使用websocket抓取js渲染页面主要有两种方式:

1.使用工具,将页面进行js渲染之后再抓取,这主要的工具有SeleniumHtmlUnit或者PhantomJs,但是这些工具都存在一定的效率问题,同时也不是那么稳定。好处是编写规则同静态页面一样。

2.分析ajax请求中的地址,因为js渲染出的数据一般也是通过ajax从后台传输过来的,而且相对于页面样式,这种接口变化可能性更小。缺点就是找到这个请求,并进行模拟,是一个相对困难的过程,也需要相对多的分析经验。


两种模式的大概模型:

  1. 后端渲染的页面

    下载辅助页面=>发现链接=>下载并分析目标HTML

  2. 前端渲染的页面

    发现辅助数据=>构造链接=>下载并分析目标AJAX

参考地址:http://webmagic.io/docs/zh/posts/chx-cases/js-render-page.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值