最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

如何使用Python進行PDF圖片識別OCR

 更新時間:2021年01月22日 15:53:43   作者:許鴻飛  
這篇文章主要介紹了如何使用Python進行PDF圖片識別OCR,幫助大家更好的理解和使用python,感興趣的朋友可以了解下

使用場景

使用圖片識別可以快速提取圖片中的信息,方便高效。

Python并不能直接對PDF進行識別,所以如果是識別PDF的話,需要先將PDF轉(zhuǎn)化為圖片,然后再進行識別。

必備工具

  • Python 

可以安裝3.7及以上版本

  • tesseract-ocr 

下載地址: https://github.com/UB-Mannheim/tesseract/wiki 使用最新版本即可

  • 需要用到的庫
pip install pillow
pip install opencv-python
pip install fitz
pip install PyMuPDF
pip install pytesseract

代碼示例

from PIL import Image
import os
import pytesseract 
import cv2 as cv
import fitz

def pdf_image(pdfPath,imgPath,zoom_x,zoom_y,rotation_angle):
  # 打開PDF文件
  pdf = fitz.open(pdfPath)
  # 逐頁讀取PDF
  for pg in range(0, pdf.pageCount):
    page = pdf[pg]
    # 設(shè)置縮放和旋轉(zhuǎn)系數(shù)
    trans = fitz.Matrix(zoom_x, zoom_y).preRotate(rotation_angle)
    pm = page.getPixmap(matrix=trans, alpha=False)
    # 開始寫圖像
    pm.writePNG(imgPath+str(pg)+".png")
    #pm.writePNG(imgPath)
  pdf.close()
pdf_path ='D:/123.pdf'
img_path ='D:/123.png'
pdf_image(pdf_path,img_path,5,5,0)
# 依賴opencv
img=cv.imread(img_path)
text=pytesseract.image_to_string(Image.fromarray(img),lang='chi_tra')
# 不依賴opencv寫法
# text=pytesseract.image_to_string(Image.open(img_path))
print(text)

總結(jié)

識別清晰的文字圖片的時候準確率非常高

但是識別手寫體的話效果不太好

注意事項

在安裝tesseract-ocr 的時候一定要記得選擇對應(yīng)的語言,不然是無法正常使用的。

以上就是如何使用Python進行PDF圖片識別OCR的詳細內(nèi)容,更多關(guān)于python pdf圖片識別ocr的資料請關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • Windows下實現(xiàn)將Pascal VOC轉(zhuǎn)化為TFRecords

    Windows下實現(xiàn)將Pascal VOC轉(zhuǎn)化為TFRecords

    今天小編就為大家分享一篇Windows下實現(xiàn)將Pascal VOC轉(zhuǎn)化為TFRecords,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-02-02
  • Windows系統(tǒng)下安裝Python的SSH模塊教程

    Windows系統(tǒng)下安裝Python的SSH模塊教程

    這篇文章主要介紹了Windows系統(tǒng)下安裝Python的SSH模塊教程,本文涵蓋了pycrypto、ecdsa、paramiko、OpenSSH、SSH等模塊的安裝,需要的朋友可以參考下
    2015-02-02
  • 關(guān)于Python參數(shù)解析器argparse的應(yīng)用場景

    關(guān)于Python參數(shù)解析器argparse的應(yīng)用場景

    這篇文章主要介紹了關(guān)于Python參數(shù)解析器argparse的應(yīng)用場景,argparse 模塊使編寫用戶友好的命令行界面變得容易,程序定義了所需的參數(shù),而 argparse 將找出如何從 sys.argv 中解析這些參數(shù),需要的朋友可以參考下
    2023-08-08
  • Django objects的查詢結(jié)果轉(zhuǎn)化為json的三種方式的方法

    Django objects的查詢結(jié)果轉(zhuǎn)化為json的三種方式的方法

    這篇文章主要介紹了Django objects的查詢結(jié)果轉(zhuǎn)化為json的三種方式的方法,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-11-11
  • 淺析python表達式4+0.5值的數(shù)據(jù)類型

    淺析python表達式4+0.5值的數(shù)據(jù)類型

    在本篇文章里小編給大家整理的是一篇關(guān)于python表達式4+0.5值的數(shù)據(jù)類型的知識點內(nèi)容,需要的的朋友們學(xué)習(xí)下。
    2020-02-02
  • python實現(xiàn)超級瑪麗游戲

    python實現(xiàn)超級瑪麗游戲

    這篇文章主要為大家詳細介紹了python實現(xiàn)超級瑪麗游戲,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2020-03-03
  • pandas round方法保留兩位小數(shù)的設(shè)置實現(xiàn)

    pandas round方法保留兩位小數(shù)的設(shè)置實現(xiàn)

    本文主要介紹了pandas round方法保留兩位小數(shù)的設(shè)置實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2022-08-08
  • 使用python進行圖片的文字識別詳細代碼

    使用python進行圖片的文字識別詳細代碼

    Tesseract OCR是一款由Google團隊開發(fā)的開源OCR引擎,用于將圖片、PDF 等格式中的文本轉(zhuǎn)換為可編輯的文本格式,本文主要介紹了Python進行圖片的文字識別功能OCR的相關(guān)知識,需要的朋友可以參考下
    2023-05-05
  • python?pandas庫讀取excel/csv中指定行或列數(shù)據(jù)

    python?pandas庫讀取excel/csv中指定行或列數(shù)據(jù)

    通過閱讀表格,可以發(fā)現(xiàn)Pandas中提供了非常豐富的數(shù)據(jù)讀寫方法,下面這篇文章主要給大家介紹了關(guān)于python利用pandas庫讀取excel/csv中指定行或列數(shù)據(jù)的相關(guān)資料,需要的朋友可以參考下
    2022-02-02
  • python讀寫ini配置文件方法實例分析

    python讀寫ini配置文件方法實例分析

    這篇文章主要介紹了python讀寫ini配置文件方法,實例分析了Python針對ini配置文件的相關(guān)讀寫技巧,需要的朋友可以參考下
    2015-06-06

最新評論

榆社县| 巴塘县| 伊春市| 浏阳市| 榆社县| 忻城县| 盖州市| 利川市| 昭平县| 南汇区| 富蕴县| 卢龙县| 罗甸县| 新宁县| 宁阳县| 长泰县| 永昌县| 高雄县| 明星| 肇州县| 湟中县| 德保县| 商水县| 宜春市| 阿城市| 剑阁县| 安阳市| 垣曲县| 杭州市| 青冈县| 无为县| 贵定县| 秀山| 彰化市| 嘉义市| 红桥区| 丰镇市| 瓦房店市| 手机| 莲花县| 修水县|