这篇文章给大家分享的是有关怎么用Python和Tesseract识别图片文字的内容。小编觉得挺实用的,因此分享给大家做个参考,一起跟随小编过来看看吧。
10年积累的网站设计、做网站经验,可以快速应对客户对网站的新想法和需求。提供各种问题对应的解决方案。让选择我们的客户得到更好、更有力的网络服务。我虽然不认识你,你也不认识我。但先网站设计后付款的网站建设流程,更有汉寿免费网站建设让你可以放心的选择与我们合作。
Linux 和 Mac 平台的安装非常简单,直接命令行安装即可,默认只有英文语言包,汉语包需要额外指定
sudo apt-get install tesseract-ocr # ubuntu
brew install tesseract # macOS
Windows 平台需要二进制安装包,官方下载地址 https://github.com/tesseract-ocr/tesseract/wiki/4.0-with-LSTM#400-alpha-for-windows,安装时需要选择中文语言包才是识别汉字
安装完成后,需要设置两个环境变量 $PATH 和 $TESSDATA_PREFIX,如果不指定后面会报错,把 tessertact 的安装路径加入 PATH 变量中,TESSDATA_PREFIX 变量的值指定为语言包的路径
Python-tesseract 是 tessertact 的 Python 封装包,它需要依赖图片处理库 PIL(Pillow),环境搭建完成后就可以开始做定制化开发了。
以下我以杜甫的《登高》作为 demo 从中提取出其中的文字
# pip install pytesseract 先安装依赖包
try:
import Image
except ImportError:
from PIL import Image
import pytesseract
# lang 指定中文简体
text = pytesseract.image_to_string(Image.open('dufu-denggao1.jpeg'), lang='chi_sim')
print(text)
输出结果:
风 急 天 高 猿 哨 哀 , 渚 清 沙 白 鸟 飞 回 。 无 边 落 木 萧 萧 下 , 不 尽 长 江 滚 滚 来 。 万 里 悲 秋 常 作 客 , 百 年 多 病 独 登 台 。 艰 难 苦 恨 繁 霜 鬓 , 漫 倒 新 停 浊 酒 杯 。
感谢各位的阅读!关于“怎么用Python和Tesseract识别图片文字”这篇文章就分享到这里了,希望以上内容可以对大家有一定的帮助,让大家可以学到更多知识,如果觉得文章不错,可以把它分享出去让更多的人看到吧!