提取数据xpath,re,css

最新推荐文章于 2025-06-24 09:20:27 发布

转载最新推荐文章于 2025-06-24 09:20:27 发布 · 219 阅读

0 ·

CC 4.0 BY-SA版权

原文链接：http://www.cnblogs.com/7134g/p/11510509.html

文章标签：

#爬虫

本文深入讲解了XPath与正则表达式(RE)的基本用法及高级技巧，包括XPath的逐层提取、文本提取、属性筛选等，以及RE的多种标志位参数如多行匹配、大小写不敏感等，为爬虫开发者提供了实用的代码片段。

XPATH

（1）/ 逐层提取

（2）text() 提取标签下面的文本

（3）//标签名提取所有的标签

（4）//标签名[num>=1] 提取相同标签名的兄弟节点。
<tr class="h">
<td class="l" width="374">职位名称</td>
<td class="">职位类别</td>
<td class="">人数</td>
<td class="">地点</td>
<td class="">发布时间</td>
</tr>
xpath('/tr[@class="h"]/td[1]/text()') #职位名称
xpath('/tr[@class="h"]/td[2]/text()') #职位类别
xpath('/tr[@class="h"]/td[3]/text()') #人数
xpath('/tr[@class="h"]/td[3]/text()') #地点

（5）//标签名[@属性='属性值'] 提取属性为...的标签
//a[@class='noactive']
//a[@class='noactive' and @id='next']

（6）@属性名取某个属性

=============================================================

re.compile(pattern, flags=0)
flags 标志位参数

re.I(re.IGNORECASE)
使匹配对大小写不敏感

re.L(re.LOCAL)
做本地化识别（locale-aware）匹配

re.M(re.MULTILINE)
多行匹配，影响 ^ 和 $

re.S(re.DOTALL)
使 . 匹配包括换行在内的所有字符

re.U(re.UNICODE)
根据Unicode字符集解析字符。这个标志影响 \w, \W, \b, \B.

re.X(re.VERBOSE)
该标志通过给予你更灵活的格式以便你将正则表达式写得更易于理解。

============================================================

转载于:https://www.cnblogs.com/7134g/p/11510509.html