摘要: OCR图像一般有两种:有格式的近距离图像或者扫描件,如身份证,名片,人民币、美元;无格式的图像,如使用Tesseract OCR 提取复杂图像中的文字。最近 有格式的近距离图像识别项目比较多,因此积累了一套版式分析(Layout Analysis)的算法,快速、可抗强干扰(光线、阴影)和噪音(污染、遮挡、背景)。特别适合证件,钱币等格式比较固定,内容较少但字比较分散的图像OCR。 阅读全文
posted @ 2012-02-06 14:40 physoft 阅读(2058) 评论(3) 推荐(1) 编辑