使用requests库和lxml解析爬取电影天堂电影信息

本文介绍了如何使用requests库和lxml解析爬取电影天堂的电影信息,包括站点分析、获取所有电影的详情链接、单个电影详情的爬取以及多页面的遍历。通过获取电影详情页的链接,可以批量下载最新最全的电影资源。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

使用requests库获取电影天堂电影信息,将所有链接保存下来后可以使用迅雷批量下载。快速获得最新最全电影资源!

站点分析

以电影天堂国内电影为例
http://www.ygdy8.net/html/gndy/china/index.html
页面分析
分析其目录内每一个电影信息存在table中,首先我们要获取每一个电影的详情地址

所有电影信息的详情链接获取

通过request,获取页面源码,xpath取得所有class="tbspan"table下面的class="ulink"a标签的@href的值,由于是相对地址,因此需要与网站地址base_url进行拼接。最后得到的就是该页面所有电影的详情地址。

base_url='http://www.ygdy8.net'
url='http://www.ygdy8.net/html/gndy/china/index.html'
def get_content(url):
    resp=requests.get(url)
    text=resp.content.decode(encoding='gbk', errors='ignore')
    html=etree.HTML(text)
    urls=html.xpath('//table[@class="tbspan"]//a[@class="ulink"][2]/@href')
    detail_urls= map(lambda url:base_url+url,urls)   
    #返回信息
    return(detail_urls)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值