小白学爬虫笔记8---信息提取的一般方法

本文介绍了一种使用Python的BeautifulSoup库从HTML文档中提取所有URL链接的方法。通过解析HTML标签并利用find_all方法,可以高效地获取指定标签内的链接信息。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

信息提取的一般方法

  • 方法一:完整解析信息的标记形式,再提取关键信息。
    • XML JSON YAML
    • 需要标记解析器 例如:bs4库的标签树遍历
    • 有点:信息解析准确
    • 缺点:提取过程繁琐,慢
  • 方法二:无视标记形式,直接搜索关键信息
    • 搜索
    • 对信息的文本查找函数即可。
    • 优点:提取过程简洁,速度较快。
    • 切刀吗“同期信息准确性与信息内容相关。
  • 融合方法:结合形式解析与搜索方法,提取关键信息
    • XML JSON YAML 搜索
    • 需要标记解析器及文本查找函数。

实例:提取HTML中所有URL连接

  • 思路:
    • 搜索到所有<a>标签
    • 解析<a>标签格式,提取href后的链接内容

 

from bs4 import BeatifulSoup
soup = BeautifulSoup(demo, "html.parser")
for link in soup.find_all('a'):
print(link.get('href'))

基于BS库的HTML内容查找方法

<>.find_all(name,attrs,recursive,string,**kwargs)  

返回一个列表类型,存储查询的结果 name:标签名称

soup.find_all('a')
soup.find_all(['a','b'])
for tag in soup.find_all(True):
    print tag.name

正则表达式库

import re # 正则表达式
for tag in soup.find_all(re.compile('b')):
    print(tag.name)

attrs:属性值

soup.find_all('p','course')
soup.find_all(id = 'link1')
soup.find_all(id = 'link')
soup.find_all(id=re.compile('link'))

recursive:是否对子孙全部检索,默认True

soup.find_all('a')
soup.find_all('a',recursive=False)

string:<>...</>标签中字符串区域进行检索

soup.find_all(string = "Basic Python")
import re
soup.find_all(string = re.compile("python"))

() 等价于与.findall() soup() 等价于soup.findall()

find_all()扩展方法

  • <>.find()
  • <>.find_parents()
  • <>.find_parent
  • <>.findnextsiblings()
  • <>.findnextsibling()
  • <>.findprevioussiblings()
  • <>.findprevioussibling()
内容概要:文章详细介绍了ETL工程师这一职业,解释了ETL(Extract-Transform-Load)的概念及其在数据处理中的重要性。ETL工程师负责将分散、不统一的数据整合为有价值的信息,支持企业的决策分析。日常工作包括数据整合、存储管理、挖掘设计支持和多维分析展现。文中强调了ETL工程师所需的核心技能,如数据库知识、ETL工具使用、编程能力、业务理解能力和问题解决能力。此外,还盘点了常见的ETL工具,包括开源工具如Kettle、XXL-JOB、Oozie、Azkaban和海豚调度,以及企业级工具如TASKCTL和Moia Comtrol。最后,文章探讨了ETL工程师的职业发展路径,从初级到高级的技术晋升,以及向大数据工程师或数据产品经理的横向发展,并提供了习资源和求职技巧。 适合人群:对数据处理感兴趣,尤其是希望从事数据工程领域的人士,如数据分析师、数据科家、软件工程师等。 使用场景及目标:①了解ETL工程师的职责和技能要求;②选择适合自己的ETL工具;③规划ETL工程师的职业发展路径;④获取相关的习资源和求职建议。 其他说明:随着大数据技术的发展和企业数字化转型的加速,ETL工程师的需求不断增加,尤其是在金融、零售、制造、人工智能、物联网和区块链等领域。数据隐私保护法规的完善也使得ETL工程师在数据安全和合规处理方面的作用更加重要。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值