背景环境: win10 64位 python3.6.3
需要安装两个包和一个引擎
在安装之前需要先安装好Python,pip并配置好环境变量
所有包的安装都是通过pip来安装的,需要在windows PowerShell中进行,并且是在 C:\Python27\Scripts目录下
1.第一个包: pytesseract
pip install pytesseract
若是出现安装错误的情况,安装不了的时候,可以将命令改为 pip.exe install pytesseract来安装
若是将pip修改为pip.exe安装成功后,那么下文的所有pip都需要改为pip.exe
2.第二个包:PIL安装
pip install PIL
若是失败了可以如下修改 pip install PILLOW
3.安装识别引擎tesseract-ocr
https://github.com/tesseract-ocr/tesseract/wiki/Downloads
找到并下载安装tesseract-ocr-setup-4.00.00dev.exe文件
安装时 额外语言,请勾选简体中文
网络不好用的可以去下面的link去下载中文训练库 chi_sim.traineddata
https://github.com/tesseract-ocr/tessdata/blob/master/chi_sim.traineddata
如果需要其他语言包下载地址:download the appropriate training data
在系统变量中添加一个TESSDATA_PREFIX,变量值还是安装路径,我的是C:\App\Tesseract-OCR
安装完成后需要配置环境变量,在系统变量path后增加 tesseract-ocr的安装地址C:\App\Tesseract-OCR;
将语言包copy到 安装路径中,我的是C:\App\Tesseract-OCR\tessdata\