爬虫系列（二）--爬取原始html

最新推荐文章于 2024-04-26 15:09:14 发布

原创

最新推荐文章于 2024-04-26 15:09:14 发布 · 2k 阅读

4 ·

CC 4.0 BY-SA版权

文章标签：

#爬虫入门 #python #python爬虫

本文是爬虫系列的第二篇，介绍如何爬取并保存特定新闻网站的HTML页面。通过提供的一组URL，简单爬虫将这些页面抓取并存储为a0-5.html。随着URL数量增多，可能需要将URL存储在文件中逐个处理。对于更复杂的任务，如提取标题和正文，将在后续文章中讨论。

爬虫系列（二）--爬取原始html

上一篇文章中已经可以爬取一个页面的数据了，从本篇开始，处理上一篇中提到的具体任务。本篇文章要实现爬取某新闻网站的某些页面，并存储下来，已经有了这些页面的url。

这是一个很简单的爬虫任务，准备几个url和上篇中最后的代码段，然后添加几行代码即可。这里实现一个只有5个url的爬虫，实际上可能有成千上万个，甚至更多。当url太多的时候可能要把url存到文件中，读一个url，写一个文件。爬取数据后存到a0-5.html中。下面是具体实现：

from urllib import request
header_dict = {
    "Accept":"application/json, text/javascript, */*; q=0.01",
    "Accept-Language":"zh-CN,zh;q=0.9",
    "User-Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_5) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.84 Safari/537.36",
    }
def get_http(load_url,header):
    res=""
    try:
        req = request.Request(url=load_url,headers=header)#创建请求对象
        coonect = request.urlopen(req)#打开该请求
        byte_res = coonect.read()#读取所有数据，很暴力
        try:
            res=byte_res.decode(encoding='utf-8')
        except:
            res=byte_res.decode(encoding='gbk')
    except Exception as e:
        print(e)

最低0.47元/天解锁文章