XPath 爬取糗事百科

最新推荐文章于 2021-10-12 13:31:15 发布

Gonietz123

最新推荐文章于 2021-10-12 13:31:15 发布

阅读量302

点赞数

CC 4.0 BY-SA版权

分类专栏：爬虫文章标签： XPath python爬虫

本文链接：https://blog.youkuaiyun.com/qq_31864971/article/details/87373062

爬虫专栏收录该内容

3 篇文章

订阅专栏

本文分享了一个使用Python进行糗事百科网站爬取的实战案例，详细介绍了如何发送请求、处理Cookies、解析网页内容并保存数据的过程。通过XPath抓取图片源链接、用户名和等级信息，展示了数据抓取的基本技巧。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

import urllib.request
import urllib.parse
import http.cookiejar
from lxml import etree

def create_request(page):
    url = 'https://www.qiushibaike.com/text/page/' + str(page) + '/'
    headers = {
            'User-Agent': 'User-Agent: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11',
    }
    request = urllib.request.Request(url=url, headers=headers)
    return request

def save_content(request):
    ck = http.cookiejar.CookieJar()
    handler = urllib.request.HTTPCookieProcessor(ck)
    opener = urllib.request.build_opener(handler)
    response = opener.open(request)
    content = response.read().decode('utf-8')
    return content

def get_xpath(content):
    tree = etree.HTML(content)
    src_list = tree.xpath('//div[@id="content-left"]/div/div//img/@src')
    alt_list = tree.xpath('//div[@id="content-left"]/div/div//img/@alt')
    level_list = tree.xpath("//div[@id='content-left']/div/div/div/text()")
    if len(src_list) == len(alt_list):
        for i in range(len(src_list)):
            src = 'https:' + src_list[i]
            print(src)
            alt = alt_list[i]
            if alt == '匿名用户':
                level_list.insert(i, '无等级')
            level = level_list[i]
            data = '头像：' + src + ' ' + '用户名：' + alt + ' ' + '等级：' + level + '\n'

            with open('user_info.txt', 'a', encoding='utf-8')as fp:
                fp.write(data)

if __name__ == '__main__':
    request = create_request(1)
    content = save_content(request)
    get_xpath(content)