Python--文字识别--Tesseract

上的二流大学学的机电设计喜欢瞎折腾所以折腾的干IT了

22 人赞同了该文章

1.介绍

Tesseract 是一个 OCR 库,目前由 Google 赞助(Google 也是一家以 OCR 和机器学习技术闻名于世的公司)。Tesseract 是目前公认最优秀、最精确的开源 OCR 系统。除了极高的精确度,Tesseract 也具有很高的灵活性。它可以通过训练识别出任何字体，也可以识别出任何 Unicode 字符。

2.安装

以下所有都是在mac上安装实现的

//安装tesseract的同时安装训练工具
brew install --with-training-tools tesseract

//安装tesseract的同时安装所有语言，语言包比较大，如果安装的话时间较长，建议不安装，按需选择
brew install  --all-languages tesseract

//安装tesseract，并安装训练工具和语言
brew install --all-languages --with-training-tools tesseract 

//只安装tesseract，不安装训练工具
brew install  tesseract

3.下载语言库

下载地址:tesseract-ocr/tessdata

默认自带的是英语

根据自己的需求选择所要的语言库，在这里我们选择的是简体中文所以选择的库是：chi_sim.traineddata

将文件拷贝到到：/usr/local/Cellar/tesseract/(你下载的版本号)/share/tessdata目录下。

4.Tesseract的命令行使用

一般使用:

//默认使用eng文字库， imgName是图片的地址，result识别结果
tesseract imgName result

指定语言:

//指定使用简体中文
tesseract -l chi_sim imgName result

//查看本地存在的语言库
tesseract --list-langs

指定多语言:

//指定多语言，用+号相连
tesseract -l chi_sim+eng imgName result

5.Tesseract在Python中使用

通过 pip 安装支持Python 版本的 Tesseract库

pip install pytesseract

通过Python代码的简单实现

import pytesseract
from PIL import Image

image = Image.open('/Users/admin/Desktop/test.jpg')
text = pytesseract.image_to_string(image)
print text

是爬虫中的验证码的识别,可以通过更换别人训练好的语言包来识别.如果想自己通过训练来获得语言包也是可以的.

6.Tesseract训练

这里放个官方文档,等我练好了再分享

[tesseract-ocr/tesseract](tesseract-ocr/tesseract)

[更多内容](ztfDeveloper的博客 - CSDN博客)

posted on 2024-01-15 10:34 漫思阅读(781) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

相关博文：

· 使用Tesseract做文字识别（OCR）

· 开源字符识别 OCR 引擎推荐

· python Tesseract 图片识别文字

· Tesseract-OCR下载和安装

· Tesseract开源的OCR工具及python pytesseract安装使用

阅读排行：
· DeepSeek “源神”启动！「GitHub 热点速览」
· 微软正式发布.NET 10 Preview 1：开启下一代开发框架新篇章
· C# 集成 DeepSeek 模型实现 AI 私有化（本地部署与 API 调用教程）
· DeepSeek R1 简明指南：架构、训练、本地部署及硬件要求
· NetPad：一个.NET开源、跨平台的C#编辑器

历史上的今天：
2020-01-15 关于Vue.use()详解
2020-01-15 vuex actions传递多参数的处理
2020-01-15 在Vuex使用以及 dispatch和commit来调用mutations的区别
2020-01-15 vuex里mapState,mapGetters使用详解
2020-01-15 Vue访问子组件实例或子元素
2020-01-15 git常用命令

漫思