Python爬虫基础——正则表达式

最新推荐文章于 2024-11-05 17:13:53 发布

原创最新推荐文章于 2024-11-05 17:13:53 发布 · 999 阅读

CC 4.0 BY-SA版权

66 篇文章

订阅专栏

29 篇文章

订阅专栏

13 篇文章

订阅专栏

本文深入探讨Python爬虫技术，从HTML、CSS到JavaScript、JQuery等网页前端技术，再到正则表达式、XPath语法的运用，以及实战中的反爬策略破解。通过多个案例分析，如Request对象的GET与POST请求、代理IP使用、模拟登录技巧，全面解析Python爬虫的搭建与优化。

说到爬虫，不可避免的会牵涉到正则表达式。
因为你需要清晰地知道你需要爬取什么信息？它们有什么共同点？可以怎么去表示它们？
而这些，都需要我们熟悉正则表达，才能更好地去提取。

先简单复习一下各表达式所代表的意思：
在这里插入图片描述

定义密码的正则表达式：
英文字母开头，可以包括数字、大小写英文字母、下划线，6-16位。
表达式为：
password_pattern='^[a-zA-Z]{1}[a-zA-Z0-9_]{5-15}$'
或password pattern='^[a-zA-Z][a-zA-Z0-9_]{5-15}$'
匹配div标签，class="class1"中的文本内容：
<div class="class1">要匹配的内容</div>
表达式为：
div_pattern1='<div class="class1">(.*)</div>'
匹配div标签中div标签，class="class1"中的文本内容：
<div><div class="class1">要匹配的内容</div></div>
表达式为：
div_pattern1='<div class="class1">(.*?)</div>'