Python:黑板课爬虫闯关第五关

本文分享了使用Python和tesserocr解决黑板课爬虫挑战第五关的实战经验,重点介绍了如何处理验证码识别,虽然识别率较低,但提供了完整的代码示例。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

Python:黑板课爬虫闯关第五关

第五关是最后一关了,至此之后黑板课就没有更新过关卡了。

第五关地址:http://www.heibanke.com/lesson/crawler_ex04/

可以看到,是在第三关的基础上加了验证码。

验证码识别我们可以通过 tesserocr 来识别,tesserocr 的使用在我的前面两篇博客中有介绍。

在这里,tesserocr 的识别率不是很高,大概只有10%到15%,通过训练,也没能有啥改善,不知道是不是我弄错了,有尝试过的朋友可以给我留言。

代码如下:

import re
import requests
import time
from PIL import Image
from bs4 import BeautifulSoup
import tesserocr


def main():
    url_login = 'http://www.heibanke.com/accounts/login/'
    url = 'http://www.heibanke.com/lesson/crawler_ex04/'
    session = requests.Session()
    session.get(url_login)
    token = session.cookies['csrftoken']
    session.post(url_login, data={'csrfmiddlewaretoken': token, 'username': 'xx', 'password': 'xx'})
    psd = 0
    while psd < 30:
        print(f'test password {psd}')
        r = session.get(url)
        soup = BeautifulSoup(r.text, 'lxml')
        img_tag = soup.find('img')
        img_url = 'http://www.heibanke.com' + img_tag['src']
        requests.get(url)
        code = get_code(img_url)
        if code is None:
            time.sleep(1)
            continue
        token = session.cookies['csrftoken']
        r = session.post(url, data={'csrfmiddlewaretoken': token, 'username': 'aa', 'password': psd,
                                    'captcha_0': code[0], 'captcha_1': code[1]})
        html = r.text
        if '验证码输入错误' in html:
            time.sleep(1)
        elif '密码错误' not in html:
            m = re.search('(?<=\<h3\>).*?(?=\</h3\>)', html)
            print(m.group())
            return
        else:
            time.sleep(1)
            psd += 1


def get_code(url):
    flag = url.split("/")[-2]
    fn = flag + '.png'
    with open(fn, 'wb+') as sw:
        sw.write(requests.get(url).content)

    img = Image.open(fn)
    img = img.convert('L')
    result = tesserocr.image_to_text(img).strip()
    print(flag, result)
    if re.match('^[A-Za-z0-9]{4}$', result):
        return flag, result


if __name__ == '__main__':
    main()

扫码关注我的个人公众号

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值