python简单的HTML解析

最新推荐文章于 2025-08-15 22:56:20 发布

转载最新推荐文章于 2025-08-15 22:56:20 发布 · 107 阅读

0 ·

CC 4.0 BY-SA版权

原文链接：https://yq.aliyun.com/articles/520846

文章标签：

#json #python

本篇博客介绍了一种使用Python爬虫技术抓取腾讯新闻网站上的新闻标题及链接的方法。通过requests库获取网页内容，并利用BeautifulSoup进行解析，最终实现对指定元素的选择和信息提取。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

# coding:utf-8

# 引入相关模块

import json
import requests
from bs4 import BeautifulSoup
url = "http://news.qq.com/"
# 请求腾讯新闻的URL，获取其text文本
wbdata = requests.get(url).text
# 对获取到的文本进行解析
soup = BeautifulSoup(wbdata,'lxml')
# 从解析文件中通过select选择器定位指定的元素，返回一个列表
news_titles = soup.select("div.text > em.f14 > a.linkto")

#对返回的列表进行遍历
for n in news_titles:
    # 提取出标题和链接信息
    title = n.get_text()
    link = n.get("href")
    data = {
        '标题':title,
        '链接':link
    }

    print json.dumps(data).decode("unicode-escape").replace(u'\ufffd', u' ')

本文转自 IT阿飞 51CTO博客，原文链接:http://blog.51cto.com/itafei/2072313