request，yield爬取网页

最新推荐文章于 2024-02-18 19:29:51 发布

转载最新推荐文章于 2024-02-18 19:29:51 发布 · 1.1k 阅读

python爬虫专栏收录该内容

4 篇文章

订阅专栏

本文基于已有的单网页爬取技术，结合Scrapy框架的多网页爬取原理，详细介绍了如何创建项目、设计数据结构、实现数据存储、编写爬虫以及执行自动爬取过程。通过设置合理的配置参数，如禁止cookies、自定义请求延时等，有效防止被目标网站识别为爬虫，确保爬取活动的可持续性和安全性。

首先，在教程（二）（http://blog.youkuaiyun.com/u012150179/article/details/32911511）中，研究的是爬取单个网页的方法。在教程（三）（http://blog.youkuaiyun.com/u012150179/article/details/34441655）中，讨论了Scrapy核心架构。现在在（二）的基础上，并结合在（三）中提到的爬取多网页的原理方法，进而进行自动多网页爬取方法研究。

并且，为了更好的理解Scrapy核心架构以及数据流，在这里仍采用scrapy.spider.Spider作为编写爬虫的基类。

首先创建project:

[python]view plaincopy
 scrapy startproject 优快云Blog  

一. items.py编写

在这里为清晰说明，只提取文章名称和文章网址。

[python]view plaincopy
 # -*- coding:utf-8 -*-  
   
 from scrapy.item import Item, Field  
   
 class CsdnblogItem(Item):  
     """存储提取信息数据结构"""  
   
     article_name = Field()  
     article_url = Field()  

二. pipelines.py编写

[python]view plaincopy
 import json  
 import codecs  
   
 class CsdnblogPipeline(object):  
   
     def __init__(self):  
         self.file = codecs.open('优快云Blog_data.json', mode='wb', encoding='utf-8')  
   
     def process_item(self, item, spider):  
         line = json.dumps(dict(item)) + '\n'  
         self.file.write(line.decode("unicode_escape"))  
   
         return item  

其中，构造函数中以可写方式创建并打开存储文件。在process_item中实现对item处理，包含将得到的item写入到json形式的输出文件中。

三. settings.py编写

对于setting文件，他作为配置文件，主要是至执行对spider的配置。一些容易被改变的配置参数可以放在spider类的编写中，而几乎在爬虫运行过程中不改变的参数在settings.py中进行配置。

[python]view plaincopy
 # -*- coding:utf-8 -*-  
   
 BOT_NAME = '优快云Blog'  
   
 SPIDER_MODULES = ['优快云Blog.spiders']  
 NEWSPIDER_MODULE = '优快云Blog.spiders'  
   
 #禁止cookies,防止被ban  
 COOKIES_ENABLED = False  
   
 ITEM_PIPELINES = {  
     '优快云Blog.pipelines.CsdnblogPipeline':300  
 }  
   
 # Crawl responsibly by identifying yourself (and your website) on the user-agent  
 #USER_AGENT = '优快云Blog (+http://www.yourdomain.com)'  

这里将COOKIES_ENABLED参数置为True，使根据cookies判断访问的站点不能发现爬虫轨迹，防止被ban。

ITEM_PIPELINES类型为字典，用于设置启动的pipeline，其中key为定义的pipeline类，value为启动顺序，默认0-1000。

四. 爬虫编写

爬虫编写始终是重头戏。原理是分析网页得到“下一篇”的链接，并返回Request对象。进而继续爬取下一篇文章，直至没有。

上码：

[python]view plaincopy
 #!/usr/bin/python  
 # -*- coding:utf-8 -*-  
   
 # from scrapy.contrib.spiders import  CrawlSpider,Rule  
   
 from scrapy.spider import Spider  
 from scrapy.http import Request  
 from scrapy.selector import Selector  
 from 优快云Blog.items import CsdnblogItem  
   
   
 class 优快云BlogSpider(Spider):  
     """爬虫优快云BlogSpider"""  
   
     name = "优快云Blog"  
   
     #减慢爬取速度 为1s  
     download_delay = 1  
     allowed_domains = ["blog.youkuaiyun.com"]  
     start_urls = [  
   
         #第一篇文章地址  
         "http://blog.youkuaiyun.com/u012150179/article/details/11749017"  
     ]  
   
     def parse(self, response):  
         sel = Selector(response)  
   
         #items = []  
         #获得文章url和标题  
         item = CsdnblogItem()  
   
         article_url = str(response.url)  
         article_name = sel.xpath('//div[@id="article_details"]/div/h1/span/a/text()').extract()  
   
         item['article_name'] = [n.encode('utf-8') for n in article_name]  
         item['article_url'] = article_url.encode('utf-8')  
   
         yield item  
   
         #获得下一篇文章的url  
         urls = sel.xpath('//li[@class="next_article"]/a/@href').extract()  
         for url in urls:  
             print url  
             url = "http://blog.youkuaiyun.com" + url  
             print url  
             yield Request(url, callback=self.parse)  

慢慢分析：

（1）download_delay参数设置为1，将下载器下载下一个页面前的等待时间设置为1s，也是防止被ban的策略之一。主要是减轻服务器端负载。

（2）从response中抽取文章链接与文章题目，编码为utf-8。注意yield的使用。

（3）抽取“下一篇”的url，由于抽取后缺少http://blog.youkuaiyun.com部分，所以补充。两个print只为调试，无实际意义。重点在于

[python]view plaincopy
 yield Request(url, callback=self.parse)  

也就是将新获取的request返回给引擎，实现继续循环。也就实现了“自动下一网页的爬取”。

五. 执行

[python]view plaincopy
 scrapy crawl 优快云Blog  

部分存储数据截图：