非结构化数据与结构化的数据提取

本文探讨了网页数据抓取中的关键步骤,包括如何处理非结构化与结构化数据,详细介绍了使用正则表达式、XPath、CSS选择器、JSONPath等技术进行数据提取的方法。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

页面解析和数据提取

一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。

  • 非结构化数据:先有数据,再有结构,

  • 结构化数据:先有结构、再有数据

  • 不同类型的数据,我们需要采用不同的方式来处理。


非结构化的数据处理

文本、电话号码、邮箱地址

  • 正则表达式

HTML 文件

  • 正则表达式

  • XPath

  • CSS选择器


结构化的数据处理

JSON 文件

  • JSON Path

  • 转化成Python类型进行操作(json类)

XML 文件

  • 转化成Python类型(xmltodict)

  • XPath

  • CSS选择器

  • 正则表达式

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值