lxml和Xpath实战

本文介绍了使用lxml库和XPath表达式进行网页数据抓取的实际操作,包括百度页面部分内容的爬取及豆瓣影评的获取。

百度页面部分爬取

import requests
from lxml import etree

#定义被爬取的网页
url = "https://www.baidu.com/"

#定义请求头
headers = {
        "User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/61.0.3163.100 Safari/537.36",
        }
#response对象,得到返回内容
response = requests.get(url, headers= headers)
content = response.content.decode('utf8')

#将html字符串解析
html = etree.HTML(content)
#使用xpath语法
contents = html.xpath("//div[@id='u1']/a/text()")#一定要加text()才能是字符串,否则返回对象。
#print(contents)
urls = html.xpath("//div[@id='u1']/a/@href")
#print(urls)

egs = []
for content,url in zip(contents,urls):
    eg = {}#每次清空字典,再添加新的字典
    eg = {
            "content":content,
            "url":url
            }
    egs.append(eg)

豆瓣影评爬取

import requests
from lxml import etree

headers = {
        "User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/61.0.3163.100 Safari/537.36",
        
        }
"""
1.构造十页的url
"""
urls = []
for i in range(0,3,1):
    i = i*20
    url = "https://movie.douban.com/review/best/?start={}".format(i)
    urls.append(url)

"""
2.获取每页所有电影的详细url
"""
#list of list格式   列表嵌套列表
detail_urls = []
for url in urls:
    response = requests.get(url,headers=headers)
    #对response进行解码
    content = response.content.decode('utf8')
    #解析HTML字符串
    html = etree.HTML(content)
    #利用Xpath语法提取详情页的url[list形式的结果]
    detail_url = html.xpath('//h2/a/@href')
#    print(detail_url)
    detail_urls.append(detail_url)#列表嵌套列表
    
print(detail_urls)


"""
3.获取每一部电影的影评数据
"""
movies = []
i = 0
for page in detail_urls:#得到每一页的url
    for url in page:#得到每一部影评的url
        try:#为了防止有一个网页不是按照之前分析的格式,出错致使程序停止,使用try,except跳过异常网页
            #发送请求
            response = requests.get(url, headers=headers)
            content = response.content.decode('utf8')
            #利用etree进行解析
            html = etree.HTML(content)
            #提取电影名
            title = html.xpath('//div[@class="subject-title"]/a/text()')[0][2:]
            #提取评论人
            commenter = html.xpath('//header/a/span/text()')[0]
            #电影评分
            rank = html.xpath('//header//span/@title')[0]
            #电影评论
            comment = html.xpath('//div[@id="link-report"]//p//text()')
            comment = ''.join(comment)
            movie = {
            "title":title,
            "commenter":commenter,
            "rank":rank,
            "comment":comment,
            }
            movies.append(movie)
        except:
            continue
    i += 1
    print("第{}页已爬取完毕!!".format(i))
【直流微电网】径向直流微电网的状态空间建模与线性化:一种耦合DC-DC变换器状态空间平均模型的方法 (Matlab代码实现)内容概要:本文介绍了径向直流微电网的状态空间建模与线性化方法,重点提出了一种基于耦合DC-DC变换器状态空间平均模型的建模策略。该方法通过对系统中多个相互耦合的DC-DC变换器进行统一建模,构建出整个微电网的集中状态空间模型,并在此基础上实施线性化处理,便于后续的小信号分析与稳定性研究。文中详细阐述了建模过程中的关键步骤,包括电路拓扑分析、状态变量选取、平均化处理以及雅可比矩阵的推导,最终通过Matlab代码实现模型仿真验证,展示了该方法在动态响应分析控制器设计中的有效性。; 适合人群:具备电力电子、自动控制理论基础,熟悉Matlab/Simulink仿真工具,从事微电网、新能源系统建模与控制研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①掌握直流微电网中多变换器系统的统一建模方法;②理解状态空间平均法在非线性电力电子系统中的应用;③实现系统线性化并用于稳定性分析与控制器设计;④通过Matlab代码复现扩展模型,服务于科研仿真与教学实践。; 阅读建议:建议读者结合Matlab代码逐步理解建模流程,重点关注状态变量的选择与平均化处理的数学推导,同时可尝试修改系统参数或拓扑结构以加深对模型通用性适应性的理解。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值