用Python將PDF文件轉(zhuǎn)存為圖片的實(shí)現(xiàn)方法
一·摘要
在Python中,將PDF文件轉(zhuǎn)換為圖片格式使用專門的庫(kù)來(lái)處理PDF文檔,并將其每一頁(yè)導(dǎo)出為常見(jiàn)的圖像格式。這可以通過(guò)PyMuPDF庫(kù)中的fitz模塊或pdf2image庫(kù)實(shí)現(xiàn),其中每個(gè)庫(kù)都提供了將PDF頁(yè)面渲染成位圖的方法。一旦頁(yè)面被轉(zhuǎn)換成圖像,就可以使用Pillow庫(kù)(即PIL庫(kù)的一個(gè)分支)將這些圖像保存為PNG或JPEG文件。此過(guò)程不僅支持將包含文本和圖形的PDF頁(yè)面精確地轉(zhuǎn)換為圖像,而且還可以處理批量轉(zhuǎn)換,使得整個(gè)轉(zhuǎn)換過(guò)程可以自動(dòng)化完成,非常適合需要從PDF中提取圖像內(nèi)容以用于報(bào)告、演示或網(wǎng)頁(yè)發(fā)布的場(chǎng)景。
二·原理
在Python中將PDF文件轉(zhuǎn)存為圖片的過(guò)程通常依賴于渲染引擎,該引擎能夠解析PDF文檔的結(jié)構(gòu)和內(nèi)容,并將其轉(zhuǎn)換成像素?cái)?shù)據(jù),即圖像。
原理如下:
解析PDF:使用庫(kù)(如
PyMuPDF或pdf2image)來(lái)讀取PDF文件。這些庫(kù)內(nèi)部使用PDF解析器來(lái)理解PDF文件的結(jié)構(gòu),包括文本、圖像、向量圖形和頁(yè)面布局信息。頁(yè)面渲染:庫(kù)中的渲染引擎會(huì)處理PDF頁(yè)面上的每個(gè)元素,如文字、線條和嵌入的圖像,并將它們轉(zhuǎn)換為可在屏幕上顯示的像素?cái)?shù)據(jù)。對(duì)于
PyMuPDF,get_pixmap()方法負(fù)責(zé)這個(gè)渲染過(guò)程;對(duì)于pdf2image,convert_from_path()方法則用于將整個(gè)PDF頁(yè)面渲染成圖像。圖像保存:一旦PDF頁(yè)面被渲染成位圖,就可以使用像Pillow這樣的圖像處理庫(kù)將其保存為常見(jiàn)的圖像格式(如PNG或JPEG)。這個(gè)過(guò)程涉及到設(shè)置圖像的分辨率、顏色深度和壓縮級(jí)別。
循環(huán)處理:因?yàn)镻DF文件可能包含多個(gè)頁(yè)面,所以上述過(guò)程需要對(duì)每一頁(yè)進(jìn)行重復(fù),直到所有頁(yè)面都被轉(zhuǎn)換成了對(duì)應(yīng)的圖像文件。
結(jié)果驗(yàn)證:轉(zhuǎn)換完成后,需要檢查生成的圖像以確保它們準(zhǔn)確地反映了原PDF頁(yè)面的內(nèi)容和布局。
這個(gè)過(guò)程不僅能夠?qū)DF中的文本和矢量圖形轉(zhuǎn)換為像素圖像,還能夠處理其中嵌入的圖像和圖表。通過(guò)適當(dāng)?shù)脑O(shè)置,可以調(diào)整輸出圖像的質(zhì)量、大小和格式,以適應(yīng)不同的用途和需求。
三·流程
將PDF文件轉(zhuǎn)換為圖片的流程可以分為以下幾個(gè)步驟:
安裝庫(kù):首先,需要安裝Python庫(kù)來(lái)處理PDF和圖像。常用的庫(kù)包括
PyMuPDF(也稱為fitz)和pdf2image。可以使用pip命令進(jìn)行安裝,例如:pip install PyMuPDF或pip install pdf2image。導(dǎo)入庫(kù):在Python腳本中,導(dǎo)入所需的庫(kù)。對(duì)于
PyMuPDF,導(dǎo)入fitz模塊;對(duì)于pdf2image,導(dǎo)入pdf2image模塊。讀取PDF文件:使用庫(kù)提供的方法打開(kāi)PDF文件。對(duì)于
PyMuPDF,可以使用fitz.open()方法打開(kāi)PDF文件;對(duì)于pdf2image,可以使用convert_from_path()方法打開(kāi)PDF文件。渲染PDF頁(yè)面:遍歷PDF的每一頁(yè),并將其渲染為圖像。對(duì)于
PyMuPDF,可以使用page.get_pixmap()方法將每一頁(yè)渲染成位圖;對(duì)于pdf2image,可以使用convert_from_path()方法將整個(gè)PDF頁(yè)面渲染成圖像。保存圖像:將渲染得到的圖像保存到本地文件系統(tǒng)中??梢允褂肞illow庫(kù)(即
PIL庫(kù)的一個(gè)分支)的save()方法來(lái)保存圖像。循環(huán)處理:對(duì)PDF中的每一頁(yè)重復(fù)步驟4和5,直到所有頁(yè)面都轉(zhuǎn)換為圖像。
處理完畢:確保所有圖像都已正確保存,并在需要時(shí)進(jìn)行任何后續(xù)處理,如調(diào)整大小、裁剪或格式轉(zhuǎn)換。
四·實(shí)戰(zhàn)演示
因工作中的某些奇葩要求,需要將PDF文件的每頁(yè)內(nèi)容轉(zhuǎn)存成按順序編號(hào)的圖片。用第三方軟件或者在線轉(zhuǎn)換也可以,但批量操作還是Python方便,所謂搞定辦公自動(dòng)化,Python出山,一統(tǒng)天下;Python出征,寸草不生。
這里先導(dǎo)入fitz庫(kù),用于將PDF文件的頁(yè)面提取成像素信息(圖片)。再導(dǎo)入glob庫(kù),用于獲取后綴為".pdf"的文件的文件名。os庫(kù)可新建文件夾
#批量將PDF文件轉(zhuǎn)為圖片
import fitz
import glob
import os
image_path = "圖片\\" #存放圖片的文件夾
PDFfiles = glob.glob("PDF文件\\*.pdf") #獲取所有pdf文件的文件名
for PDFfile in PDFfiles: #遍歷所有PDF文件
PDFdoc = fitz.open(PDFfile) #讀取PDF文件
folder_name = PDFfile.split("\\")[-1].split(".")[0] #按源文件名新建文件夾
for pg in range(PDFdoc.pageCount): #根據(jù)PDF的頁(yè)數(shù),按頁(yè)提取圖片
page = PDFdoc[pg]
#增強(qiáng)圖片分辨率
zoom_x = 3 #水平方向
zoom_y = 3 #垂直方向
mat = fitz.Matrix(zoom_x, zoom_y)
pix = page.getPixmap(matrix=mat)
#按原PDF名稱新建文件夾并按順序保存圖片
if not os.path.exists(image_path+folder_name):#判斷文件夾是否已存在
os.makedirs(image_path+folder_name)#不存在則新建,存在就跳過(guò)這行
pix.writeImage(image_path+folder_name + "\\{}.png".format(str(pg+1))) #按PDF中的頁(yè)面順序命名并保存圖片
以上,我們先將所有待處理的PDF文件放入“PDF文件夾”,然后通過(guò)glob.glob(“PDF文件\*.pdf”)搜索并抓取所有以".pdf"為后綴的文件,并存入變量PDFfiles中。
結(jié)果如下所示:
PDFfiles

然后,遍歷PDFfiles中的所有PDF文件,使用fitz.open()讀取。fitz.open()用于創(chuàng)建PDF文件中頁(yè)面的像素映射(pixel maps),即用像素來(lái)表示頁(yè)面信息。然后按PDF文件名命名一個(gè)新的文件夾,以便儲(chǔ)存圖片。比如給“收貨記錄.pdf”文件建一個(gè)名字為“收貨記錄”的文件夾,專門儲(chǔ)存關(guān)于它的頁(yè)面的圖片。隨后用for循環(huán),根據(jù)PDF的頁(yè)數(shù),按頁(yè)提取圖片。將每頁(yè)的信息存入page變量,它的type 是fitz.fitz.Page,即一頁(yè)像素文件。為了讓圖片看起來(lái)更清晰,需要增強(qiáng)圖片的分辨率,設(shè)定圖片水平及垂直方向的增強(qiáng)倍數(shù),傳入Matrix。Matrix用于提升即將保存的圖片的分辨率,分辨率的提升倍數(shù)為zoom_x與zoom_y的乘積。倍數(shù)越大,圖片越清晰,當(dāng)然占用空間也越大。這個(gè)參數(shù)可根據(jù)實(shí)際要求調(diào)整。然后將Matrix存入mat,傳入getPixmap()。getPixmap()用于控制圖片分辨率、色域(比如生成灰度圖像或帶有減色方案的圖像)、透明度、旋轉(zhuǎn)、鏡像、移位、剪切等。由于其它都不需要專門設(shè)定,所以只增強(qiáng)其分辨率。
一頁(yè)圖片處理好后,就需要保存圖片了。先通過(guò)os.path.exists判斷一下需要的文件夾是否存在,若不存在就通過(guò)os.makedirs創(chuàng)建。然后用pix.writeImage按頁(yè)碼編號(hào)寫入并保存圖片。

以上就是用Python將PDF文件轉(zhuǎn)存為圖片的方法的詳細(xì)內(nèi)容,更多關(guān)于Python PDF文件轉(zhuǎn)圖片的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!
相關(guān)文章
Django CSRF跨站請(qǐng)求偽造防護(hù)過(guò)程解析
這篇文章主要介紹了Django CSRF跨站請(qǐng)求偽造防護(hù)過(guò)程解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2019-07-07
Python實(shí)現(xiàn)隨機(jī)森林算法的示例代碼
隨機(jī)森林的英文是 Random Forest,英文簡(jiǎn)寫是 RF,也是常用的人工智能算法,本文為大家介紹了Python實(shí)現(xiàn)隨機(jī)森林算法的示例代碼,希望對(duì)大家有所幫助2023-06-06
python使用__slots__讓你的代碼更加節(jié)省內(nèi)存
如果要限制添加的屬性,例如,Student類只允許添加 name、gender和score 這3個(gè)屬性,就可以利用Python的一個(gè)特殊的slots來(lái)實(shí)現(xiàn)。這篇文章主要給大家介紹了關(guān)于python如何使用__slots__讓你的代碼更加節(jié)省內(nèi)存的相關(guān)資料,需要的朋友可以參考下2018-09-09
python框架中flask知識(shí)點(diǎn)總結(jié)
這篇文章給大家分享了關(guān)于學(xué)習(xí)python框架中flask知識(shí)點(diǎn)的總結(jié)內(nèi)容,有興趣的朋友們可以學(xué)習(xí)下。2018-08-08
Matplotlib實(shí)戰(zhàn)之堆疊面積圖繪制詳解
堆疊面積圖和面積圖都是用于展示數(shù)據(jù)隨時(shí)間變化趨勢(shì)的統(tǒng)計(jì)圖表,但它們的特點(diǎn)有所不同,堆疊面積圖既能看到各數(shù)據(jù)系列的走勢(shì),又能看到整體的規(guī)模,下面我們就來(lái)看看如何繪制堆疊面積圖吧2023-08-08
pycharm配置anaconda環(huán)境時(shí)找不到python.exe的兩種解決辦法
如果你在Anaconda中創(chuàng)建了虛擬環(huán)境,但是無(wú)法找到python.exe,可能是因?yàn)樘摂M環(huán)境的Python路徑?jīng)]有添加到系統(tǒng)環(huán)境變量中,這篇文章主要給大家介紹了關(guān)于pycharm配置anaconda環(huán)境時(shí)找不到python.exe的兩種解決辦法,需要的朋友可以參考下2024-07-07
Python實(shí)現(xiàn)將多個(gè)文件的名稱或后綴名由大寫改為小寫
這篇文章主要介紹了如何基于Python語(yǔ)言實(shí)現(xiàn)將多個(gè)文件的名稱或后綴名由大寫字母修改為小寫,文中的示例代碼講解詳細(xì),感興趣的可以了解下2023-09-09

