python爬虫教程：用scrapy实现模拟登录

最新推荐文章于 2024-06-02 22:17:58 发布

最新推荐文章于 2024-06-02 22:17:58 发布 · 735 阅读

·

0

·

文章标签：

#python #爬虫 #scrapy #开发语言 #pycharm #学习

本文介绍了如何使用Scrapy进行模拟登录，以访问需要登录后才能抓取的网页。通过GET登录页面获取所需信息，然后使用POST方法和FormRequest.from_response方法提交登录数据，包括用户名和密码。成功登录后，携带Cookie继续爬取其他页面。

前言

嗨喽~大家好呀，这里是魔王呐 ❤ ~!

python更多源码/资料/解答/教程等点击此处跳转文末名片免费获取

背景：

初来乍到的pythoner，刚开始的时候觉得所有的网站无非就是分析HTML、json数据，但是忽略了很多的一个问题，有很多的网站为了反爬虫，除了需要高可用代理IP地址池外，还需要登录。

例如知乎，很多信息都是需要登录以后才能爬取，但是频繁登录后就会出现验证码（有些网站直接就让你输入验证码），这就坑了，毕竟运维同学很辛苦，该反的还得反，那我们怎么办呢？

这不说验证码的事儿，你可以自己手动输入验证，或者直接用云打码平台，这里我们介绍一个scrapy的登录用法。

测试登录地址：http://example.webscraping.com/places/default/user/login
测试主页：http://example.webscraping.com/user/profile

快速登录方法：

我们在这里做了一个简单的介绍，我们都知道scrapy的基本请求流程是start_request方法遍历start_urls列表，然后make_requests_from_url方法，里面执行Request方法，请求start_urls里面的地址，但是这里我们用的不再是GET方法，而用的是POST方法，也就常说的登录。

1. 首先我们改写start_reqeusts方法，

直接GET登录页面的HTML信息（有些人说你不是POST登录么，干嘛还GET，别着急，你得先GET到登录页面的登录信息，才知道登录的账户、密码等怎么提交，往哪里提交）

2. start_request方法GET到数据后，用callback参数，

执行拿到response后要接下来执行哪个方法，然后在login方法里面写入登录用户名和密码（还是老样子，一定要用dict），然后只用Request子类scrapy.FormRequest这个方法提交数据，这我一个的是FormRequest.from_response方m_法。

有些人会问，这个from__response的基本使用是条用是需要传入一个response对象作为第一个参数，这个方法会从页面中form表单中，帮助用户创建FormRequest对象，最最最最重要的是它会帮你把隐藏的input标签中的信息自动跳入表达，使用这个中方法，我们直接写用户名和密码即可，我们在最后面再介绍传统方法。

3. parse_login方法是提交完表单后callback回调函数指定要执行的方法，

为了验证是否成功。这里我们直接在response中搜索Welcome Liu这个字眼就证明登录成功。

这个好理解，重点是yield from super().start_resquests()，这个代表着如果一旦登录成功后，就直接带着登录成功后Cookie

最低0.47元/天解锁文章

评论

成就一亿技术人!

拼手气红包6.0元

还能输入1000个字符

添加红包

插入表情

表情包

代码片

HTML/XML
objective-c
Ruby
PHP
C
C++
JavaScript
Python
Java
CSS
SQL
其它

条评论被折叠查看

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。