一、Tesseract介绍
tesseract 是一个google支持的开源ocr项目,支持多种语言的文本识别,能够识别图片中的文字并将其转换为可编辑和可搜索的数据格式,适用于文档扫描、图像处理、数字存档等多种应用场景。
其项目地址:https://github.com/tesseract-ocr/tesseract
目前最新的源码可以在这里下载
二、Tesseract安装包下载
官方发布的3.02版本下载地址:
德国曼海姆大学发行的3.05版本下载地址
http://digi.bib.uni-mannheim.de/tesseract/tesseract-ocr-setup-3.05.00dev.exe
imon Eigeldinger (@DomasoFan) 维护的另一个版本
值得称道的是,这个网址里还有一个比较详细的说明
三、Tesseract ocr使用
安装之后,默认目录C:\Program Files (x86)\Tesseract-OCR,你需要把这个路径放到你操作系统的path搜索路径中,否则后面使用起来会不方便。
在安装目录C:\Program Files (x86)\Tesseract-OCR下可以看到 tesseract.exe这个命令行执行程序
tesseract 1.png output-l eng -psm 7
-psm 7 表示用单行文本识别 pagesegmode值:
0 =定向和脚本检测(OSD)。
1 =带OSD的自动页面分割。
2 =自动页面分割,但没有OSD或OCR
3 =全自动页面分割,但没有OSD。(默认)
4 =假设一列可变大小的文本。
5 =假设一个统一的垂直对齐文本块。
6 =假设一个统一的文本块。
7 =将图像作为单个文本行处理。
8 =把图像当作一个单词。
9 =把图像当作一个圆圈中的一个词来对待。
10 =将图像作为单个字符处理