一个Python爬虫案例，带你掌握xpath数据解析方法

宋宋讲编程

于 2023-01-13 09:26:26 发布

阅读量425

点赞数

分类专栏：数据分析 Python 文章标签： python 爬虫开发语言

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/qiqi1220/article/details/128669418

版权

文章目录

xpath基本概念
xpath解析原理
环境安装
如何实例化一个etree对象：
xpath(‘xpath表达式’)
xpath爬取58二手房实例
爬取网址
完整代码
效果图
xpath图片解析下载实例
爬取网址
完整代码
效果图
xpath爬取全国城市名称实例
爬取网址
完整代码
效果图
xpath爬取简历模板实例
爬取网址
完整代码
效果图

xpath基本概念

xpath解析：最常用且最便捷高效的一种解析方式。通用性强。

xpath解析原理

1.实例化一个etree的对象，且需要将被解析的页面源码数据加载到该对象中

2.调用etree对象中的xpath方法结合xpath表达式实现标签的定位和内容的捕获。

环境安装

pip install lxml

如何实例化一个etree对象：

from lxml import etree

1.将本地的html文件中的远吗数据加载到etree对象中：

etree.parse(filePath)

2.可以将从互联网上获取的原码数据加载到该对象中：

etree.HTML(‘page_text’)

xpath(‘xpath表达式’)

/:表示的是从根节点开始定位。表示一个层级
//:表示多个层级。可以表示从任意位置开始定位
属性定位：//div[@class='song'] tag[@attrName='attrValue']
索引定位：//div[@class='song']/p[3] 索引从1开始的
取文本

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。