scrapy_redis 解决空跑问题,自动关闭爬虫

当使用scrapy_redis框架时,如果没有requests,爬虫会阻塞等待,无法自动结束。通过监听`spider_idle`信号并在指定时间后判断仍无任务,则可发送关闭爬虫的信号。在`extensions.py`中自定义逻辑,配置scrapy扩展来实现这一功能。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

使用过scrapy_redis框架的人一定知道,scrapy redis 在没有requests的时候,会阻塞等待接收start_url,程序无法自动结束。那如何自动停止程序,结束空跑呢???
spider_idle 信号

scrapy.signals.spider_idle(spider)
当spider进入空闲(idle)状态时该信号被发送。空闲意味着:

requests正在等待被下载
requests被调度
items正在item pipeline中被处理
当该信号的所有处理器(handler)被调用后,如果spider仍然保持空闲状态, 引擎将会关闭该spider。当spider被关闭后, spider_closed 信号将被发送。

您可以,比如,在 spider_idle 处理器中调度某些请求来避免spider被关闭。

该信号 不支持 返回deferreds。

参数:	spider (Spider 对象) – 空闲的spider

了解了spider_idle 信号,大家有嗅到什么么?
对于scrapy_reids为何不能自动停止, scrapy_redis源码是这样的:

   def spider_idle(self):
        """Schedules a request if available, otherwise waits."""
        # XXX: Handle a sentinel to close the spider.
        self.schedule_next_requests()    # 这里调用schedule_next_requests() 来从redis中生成新的请求
        raise DontCloseSpider              # 抛出不要关闭爬虫的DontCloseSpider异常,保证爬虫活着

现在应该都清楚了吧,是因为scrapy_redis 从来不关闭spider。按照这个逻辑,我们可以在spider_idle 里加入自己的想法,比如 半个小时之后 spider还是空

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值