Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决

本文主要是介绍Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决

1. 安装

  1. python3.7+

  2. pip install pytesseract==0.1.9

  3. 安装tesseract-ocr(配置path环境变量或者在代码中指定tesseract_cmd)

2.报错及解决

2.1 TesseractNotFoundError

  • 报错: 无可执行的tesseract
  • 解决:配置PATH环境变量或者在代码中指定tesseract_cmd
import pytesseract# 如果未在PATH中配置tesseract环境变量,则需要手动设置tesseract可执行文件的全路径
pytesseract.pytesseract.tesseract_cmd = r'D:\tesseract\tesseract.exe'
# Example tesseract_cmd = r'C:\Program Files (x86)\Tesseract-OCR\tesseract'

2.2 Error opening data file D:\Tesseract-OCR\fra.traineddata Please make sure the TESSDATA_PREFIX environment variable is set to your “tessdata” directory. Failed loading language ‘fra’ Tesseract couldn’t load any languages! Could not initialize tesseract

  • 解决: 把fra.traineddata放到tesseract.exe上一级./tessdata的路径 或者在代码中导入:
import osimport pytesseract# 语言文件.traindata
os.environ['TESSDATA_PREFIX'] = 'D:\\tesseract\\tessdata'  # 在PATH中配置tesseract环境变量或者此处指定# 如果未在PATH中配置tesseract环境变量,则需要手动设置tesseract可执行文件的全路径
pytesseract.pytesseract.tesseract_cmd = r'D:\\tesseract\\tesseract.exe'

2.3 raise TesseractError(proc.returncode, get_errors(error_string)) pytesseract.pytesseract.TesseractError: (1, ‘Estimating resolution as 304 UZN file C:\Users\ADMINI~1\AppData\Local\Temp\tess_oeu8q72f loaded. Warning. Invalid resolution 0 dpi. Using 70 instead. Too few characters. Skipping this page Error during processing.’)

直接执行命令行ok,pytesseract.image_to_osd(Image.open(‘test.png’))) 报错

tesseract E:\mat\py-demo-22\extreme_points\images\normal.jpg E:\mat\py-demo-22\extreme_points\images\normal_1 -l osd --psm 0
  • 报错:tesseract升级的bug

  • 解决:直接传递照片文件路径,或者切回低版本的tesseract:5.0.0-alpha-20201224 ok。详情可参考
    在这里插入图片描述
    在这里插入图片描述

# 获取方向和文本系统
# print(pytesseract.image_to_osd(Image.open('test.png'))) # happening on tesseract version released after Jan1, 2021.I have tested in tesseract version 5.0.0-alpha-20201224
print(pytesseract.image_to_osd('test.png'))

遇到其他问题了可以去github issues里找解决办法;

3. 源码

# 测试pytesseract的方法
# test_osd.py
import osimport pytesseract
from PIL import Image# 语言文件.traindata
os.environ['TESSDATA_PREFIX'] = 'D:\\tesseract\\tessdata'  # 在PATH中配置tesseract环境变量或者此处指定# 如果未在PATH中配置tesseract环境变量,则需要手动设置tesseract可执行文件的全路径
pytesseract.pytesseract.tesseract_cmd = r'D:\\tesseract\\tesseract.exe'# 图片转string
print("PIL image_to_string: ", pytesseract.image_to_string(Image.open('test.png')))# 提供图片的相对或者绝对路径
print('image_to_string: ', pytesseract.image_to_string('test.png'))# 打印pytesseract支持的所有语言
print('langs: ', pytesseract.get_languages(config=''))# French语言的识别
print('fra image_to_string: ',pytesseract.image_to_string(Image.open('test-european.jpg'), lang='fra'))# 批量处理单个文件list
print('batch Images image_to_string: ',pytesseract.image_to_string('images.txt'))# 超时后结束pyteseract
try:print(pytesseract.image_to_string('test.jpg', timeout=2))  # Timeout after 2 secondsprint(pytesseract.image_to_string('test.jpg', timeout=0.5))  # Timeout after half a second
except RuntimeError as timeout_error:# Tesseract processing is terminatedpass# 获取预测的边界框
# print(pytesseract.image_to_boxes(Image.open('test.png')))
print('image_to_boxes: ',pytesseract.image_to_boxes('test.png'))# 获取详细数据,包括方框、置信度、行号和页码
print('image_to_data: ',pytesseract.image_to_data(Image.open('test.png')))# 获取方向和文本系统
# print(pytesseract.image_to_osd(Image.open('test.png')))  # but this issue is happening on tesseract version released after Jan1, 2021.I have tested in tesseract version 5.0.0-alpha-20201224
print('image_to_osd: ',pytesseract.image_to_osd('test.png'))# Get a searchable PDF
# pdf = pytesseract.image_to_pdf_or_hocr('test.png', extension='pdf') # 报错
# with open('test.pdf', 'w+b') as f:
#     f.write(pdf) # pdf type is bytes by default# Get HOCR output
# hocr = pytesseract.image_to_pdf_or_hocr('test.png', extension='hocr') # error tesseract v5.2.0.20220712 # Get ALTO XML output
xml = pytesseract.image_to_alto_xml('test.png')
print('image_to_alto_xml: ', xml)

参考

  • https://digi.bib.uni-mannheim.de/tesseract/
  • https://pypi.org/project/pytesseract/0.1.9/
  • https://github.com/seminar2012/tesseract?organization=seminar2012&organization=seminar2012
  • 各版本语言包下载路径:

这篇关于Windows pytesseract image_to_osd Invalid resolution 0 dpi. Using 70 instead. Too few characters报错及解决的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/486624

相关文章

Spring的RedisTemplate的json反序列泛型丢失问题解决

《Spring的RedisTemplate的json反序列泛型丢失问题解决》本文主要介绍了SpringRedisTemplate中使用JSON序列化时泛型信息丢失的问题及其提出三种解决方案,可以根据性... 目录背景解决方案方案一方案二方案三总结背景在使用RedisTemplate操作redis时我们针对

SpringBoot整合Dubbo+ZK注册失败的坑及解决

《SpringBoot整合Dubbo+ZK注册失败的坑及解决》使用Dubbo框架时,需在公共pom添加依赖,启动类加@EnableDubbo,实现类用@DubboService替代@Service,配... 目录1.先看下公共的pom(maven创建的pom工程)2.启动类上加@EnableDubbo3.实

nginx中端口无权限的问题解决

《nginx中端口无权限的问题解决》当Nginx日志报错bind()to80failed(13:Permissiondenied)时,这通常是由于权限不足导致Nginx无法绑定到80端口,下面就来... 目录一、问题原因分析二、解决方案1. 以 root 权限运行 Nginx(不推荐)2. 为 Nginx

解决1093 - You can‘t specify target table报错问题及原因分析

《解决1093-Youcan‘tspecifytargettable报错问题及原因分析》MySQL1093错误因UPDATE/DELETE语句的FROM子句直接引用目标表或嵌套子查询导致,... 目录报js错原因分析具体原因解决办法方法一:使用临时表方法二:使用JOIN方法三:使用EXISTS示例总结报错原

Windows环境下解决Matplotlib中文字体显示问题的详细教程

《Windows环境下解决Matplotlib中文字体显示问题的详细教程》本文详细介绍了在Windows下解决Matplotlib中文显示问题的方法,包括安装字体、更新缓存、配置文件设置及编码調整,并... 目录引言问题分析解决方案详解1. 检查系统已安装字体2. 手动添加中文字体(以SimHei为例)步骤

nginx 负载均衡配置及如何解决重复登录问题

《nginx负载均衡配置及如何解决重复登录问题》文章详解Nginx源码安装与Docker部署,介绍四层/七层代理区别及负载均衡策略,通过ip_hash解决重复登录问题,对nginx负载均衡配置及如何... 目录一:源码安装:1.配置编译参数2.编译3.编译安装 二,四层代理和七层代理区别1.二者混合使用举例

Java中读取YAML文件配置信息常见问题及解决方法

《Java中读取YAML文件配置信息常见问题及解决方法》:本文主要介绍Java中读取YAML文件配置信息常见问题及解决方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要... 目录1 使用Spring Boot的@ConfigurationProperties2. 使用@Valu

SQL Server配置管理器无法打开的四种解决方法

《SQLServer配置管理器无法打开的四种解决方法》本文总结了SQLServer配置管理器无法打开的四种解决方法,文中通过图文示例介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的... 目录方法一:桌面图标进入方法二:运行窗口进入检查版本号对照表php方法三:查找文件路径方法四:检查 S

Redis出现中文乱码的问题及解决

《Redis出现中文乱码的问题及解决》:本文主要介绍Redis出现中文乱码的问题及解决,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1. 问题的产生2China编程. 问题的解决redihttp://www.chinasem.cns数据进制问题的解决中文乱码问题解决总结

Python中Tensorflow无法调用GPU问题的解决方法

《Python中Tensorflow无法调用GPU问题的解决方法》文章详解如何解决TensorFlow在Windows无法识别GPU的问题,需降级至2.10版本,安装匹配CUDA11.2和cuDNN... 当用以下代码查看GPU数量时,gpuspython返回的是一个空列表,说明tensorflow没有找到