python+selenium十三:破解简单的图形验证码

本文介绍使用Python和Selenium结合PyTesseract与Tesseract-OCR破解简单图形验证码的方法。通过安装必要的软件和调整配置,可以实现从图片中读取验证码内容。文章提供了详细的步骤和代码示例。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

python+selenium十三:破解简单的图形验证码

 

此方法可破解简单的验证码,如:

 注:中文识别正在寻找办法

安装:

1、python3

2、Pillow

3、pytesseract

4、tesseract-ocr    下载地址:https://pan.baidu.com/s/1kXIsg1S9CqgSpgzeg9T59Q

 

安装tesseract-ocr后,在pytesseract源码中将

tesseract_cmd=‘’改为本地安装的tesseract-ocr 的目录:

tesseract_cmd = r'C:\Program Files (x86)\Tesseract-OCR\tesseract.exe'

 

 

找一张验证码的图片保存,爬虫也好,selenium截屏也好,保存到本地,再进行识别

 

 

 代码


import pytesseract
from PIL import Image
from PIL import ImageEnhance

def readImage(path):
img = Image.open(path) # 根据地址,读取图片
imgry = img.convert('L') # 图像加强,二值化
sharpness = ImageEnhance.Contrast(imgry) # 对比度增强
sharp_img = sharpness.enhance(2.0)
sharp_img.save("new.png") # 将处理后的图片,保存为new.png
image = Image.open('new.png') # 打开处理后的图片
code = pytesseract.image_to_string(image) # 读取里面的内容
return code

if __name__=="__main__":
path = '3.png'
a = readImage(path)
print(a)

 

附下载地址: tesseract-ocr的版本与语言包的版本必须对应

 tesseract-ocr 各版本下载地址:https://digi.bib.uni-mannheim.de/tesseract/

 tesseract-ocr 各版本语言包下载地址:https://github.com/tesseract-ocr/tesseract/wiki/Data-Files#cube-data-files-for-version-304305

转载于:https://www.cnblogs.com/dwdw/p/9998677.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值