OCR - 版式分析
OCR图像一般有两种:有格式的近距离图像或者扫描件,如身份证,名片,人民币、美元;无格式的图像,如 使用Tesseract OCR 提取复杂图像中的文字。
最近 有格式的近距离图像识别项目比较多,因此积累了一套版式分析(Layout Analysis)的算法,快速、可抗强干扰(光线、阴影)和噪音(污染、遮挡、背景)。特别适合证件,钱币等格式比较固定,内容较少但字比较分散的图像OCR。
OCR图像一般有两种:有格式的近距离图像或者扫描件,如身份证,名片,人民币、美元;无格式的图像,如 使用Tesseract OCR 提取复杂图像中的文字。
最近 有格式的近距离图像识别项目比较多,因此积累了一套版式分析(Layout Analysis)的算法,快速、可抗强干扰(光线、阴影)和噪音(污染、遮挡、背景)。特别适合证件,钱币等格式比较固定,内容较少但字比较分散的图像OCR。