Python腳本實現(xiàn)將PDF批量轉(zhuǎn)換為圖片
前言
這段Python代碼演示了如何將PDF文件轉(zhuǎn)換為圖片。代碼使用PyMuPDF(fitz)庫,將指定PDF的每一頁以200dpi的高質(zhì)量渲染為PNG圖片,并按頁碼順序命名保存到輸出目錄。程序會顯示轉(zhuǎn)換進度,包括每頁的尺寸,最后匯總轉(zhuǎn)換的頁數(shù)和輸出文件列表。
主要步驟包括:設(shè)置輸入/輸出路徑、創(chuàng)建輸出目錄、逐頁渲染圖片并保存、輸出轉(zhuǎn)換結(jié)果統(tǒng)計
完整代碼
import fitz
import os
BASE_DIR = r'c:\Users\zhang\Desktop\demo'
PDF_PATH = os.path.join(BASE_DIR, 'document.pdf')
OUTPUT_DIR = os.path.join(BASE_DIR, 'document_images')
# 創(chuàng)建輸出目錄
os.makedirs(OUTPUT_DIR, exist_ok=True)
print(f'=== PDF轉(zhuǎn)圖片 ===')
print(f'輸入文件: {PDF_PATH}')
print(f'輸出目錄: {OUTPUT_DIR}')
print()
# 打開PDF
doc = fitz.open(PDF_PATH)
print(f'PDF頁數(shù): {len(doc)}')
print()
# 逐頁轉(zhuǎn)換
for page_num in range(len(doc)):
page = doc[page_num]
# 渲染為圖片 (dpi=200 保證高質(zhì)量)
pix = page.get_pixmap(dpi=200)
# 生成文件名
output_path = os.path.join(OUTPUT_DIR, f'page_{page_num + 1:03d}.png')
# 保存圖片
pix.save(output_path)
print(f' 第 {page_num + 1} 頁 -> {os.path.basename(output_path)} ({pix.width}x{pix.height})')
page_count = len(doc)
doc.close()
print()
print('=== 完成 ===')
print(f'共轉(zhuǎn)換 {page_count} 頁,圖片保存在: {OUTPUT_DIR}')
# 驗證生成的文件
output_files = sorted([f for f in os.listdir(OUTPUT_DIR) if f.endswith('.png')])
print(f'生成的文件: {output_files}')
知識擴展
python將pdf轉(zhuǎn)換圖片
# -*- coding:utf-8 -*-
# Author : yyzhang56
# 所有的圖片與PDF轉(zhuǎn)換的操作都在這里進行定義
from multiprocessing import Pool
# 安裝fitz需要安裝PyMuPDF才能使用
import fitz
import os
tmp = r'C:\Users\Downloads\' #pdf路徑
export_file=r"D:\new_dates\數(shù)據(jù)"
save_path=r"D:\new_dates\ocr_result"
os.makedirs(export_file,exist_ok=True)
pdf_dir = [i for i in os.listdir(tmp) if os.path.splitext(i)[-1] == ".pdf"]
def pdf_to_jpg(name):
# lock.acquire()
#拼接pdf的文件路徑
pwd_name=os.path.join(tmp,name)
doc=fitz.open(pwd_name)
# 將文件名同我們的保存路徑拼接起來(保存圖片的文件夾)
dir_name=os.path.splitext(name)[0]
pdf_name = os.path.join(export_file, dir_name)
# print(pdf_name)
temp = 0
#(保存圖片的文件夾)不存咋則生成
# exsitsdir.judge(pdf_name)
os.makedirs(pdf_name,exist_ok=True)
for pg in range(doc.pageCount):
page = doc[pg]
temp += 1
rotate = int(0)
# 每個尺寸的縮放系數(shù)為2,這將為我們生成分辨率提高四倍的圖像。
zoom_x = 2.0
zoom_y = 2.0
trans = fitz.Matrix(zoom_x, zoom_y).preRotate(rotate)
pm = page.getPixmap(matrix=trans, alpha=False)
pic_name = '{}.jpg'.format(temp)
#拼接生成pdf的文件路徑
pic_pwd = os.path.join(pdf_name, pic_name)
# print(pic_pwd)
pm.writePNG(pic_pwd)
def main():
pool = Pool(10)
for i in pdf_dir:
res = pool.apply_async(pdf_to_jpg, (i,))
pool.close()
pool.join()
if __name__ == '__main__':
main() #需要pdf切圖就開啟圖片轉(zhuǎn)pdf
#Author:yyzhang56
from PIL import Image
import os
from PyPDF2 import PdfFileReader, PdfFileWriter
# 單張圖片轉(zhuǎn)pdf
# img = Image.open('優(yōu)化.png')
# img.save('pypdf01.pdf', 'PDF') # 通過PIL庫保存為pdf格式
# 多張圖片轉(zhuǎn)pdf
# ilst = ['D:/docOfStu/pypdf2-mindmap-01.jpg', 'D:/docOfStu/pypdf2-mindmap-02.jpg'] # 圖片列表
path=r"C:\Users\Desktop\pdf\tif_pic"
ilst=os.listdir(path)
out_pdf = PdfFileWriter()
sdfs=[os.path.join(path,i) for i in ilst ]
print(sdfs)
for f in sdfs:
img = Image.open(f)
fw = f.replace('.png', '.pdf')
img.save(fw)
out_pdf.appendPagesFromReader(PdfFileReader(
open(fw, 'rb'))) # 也可拆這句為 sc_pdf=PdfFileReader(open(fw,'rb')); out_pdf.addPage(sc_pdf.getPage(0))
out_pdf.write(open('./pypdf2.pdf', 'wb'))pdf轉(zhuǎn)docx
import os
from pdf2docx import Converter
'''
author--yyzhang
'''
pdf_path = r"C:\Users\Desktop\pdf\files" # pdf路徑
docx_path = r"C:\Users\Desktop\pdf\docx" # 保存docx路徑
# 如果保存的路徑不存在可以自動生成
if os.path.exists(docx_path):
pass
else:
os.makedirs(docx_path)
pdf_files = os.listdir(pdf_path)
# 遍歷pdf路徑下的文件
for pdf_file in pdf_files:
if pdf_file.endswith(".pdf") or pdf_file.endswith(".PDF"):
head_name = os.path.splitext(pdf_file)[0] #獲取文件名
docx_name = head_name + ".docx" #創(chuàng)建docx名稱
file_path = os.path.join(pdf_path, pdf_file) #獲取pdf絕對路徑
docx_file_path = os.path.join(docx_path, docx_name) #獲取docx絕對路徑
cv = Converter(file_path)
cv.convert(docx_file_path, start=0, end=None)
cv.close()python小腳本批量將PDF文件轉(zhuǎn)換成圖片
用法:選擇PDF文件所在的目錄,點擊 確定 后,自動將該目錄下的所有PDF轉(zhuǎn)換成單個圖片,圖片名稱為: pdf文件名.page_序號.jpg
如運行中報錯,需要自行根據(jù)報錯內(nèi)容按照缺失的庫
例如:
#安裝庫 pip install pyautogui #安裝庫 pip install pillow
這里提供兩種源碼,第一種是在代碼中手動添加pdf所在目錄
import os
import glob
from PyPDF2 import PdfReader
from pdf2image import convert_from_path
pdf_dir = "path/to/pdf_dir/" #pdf目錄
# 遍歷目錄中的PDF文件
pdf_files = glob.glob(os.path.join(pdf_dir, "*.pdf"))
# 遍歷每個PDF文件,并將其轉(zhuǎn)換為圖片
for pdf_file in pdf_files:
# 創(chuàng)建PdfReader對象
pdf = open(pdf_file, 'rb')
pdf_reader = PdfReader(pdf)
# 遍歷PDF的頁面并將其轉(zhuǎn)換為圖片
for page_num in range(len(pdf_reader.pages)):
# 獲取頁面對象
page = pdf_reader.pages[page_num]
# 將PDF頁面轉(zhuǎn)換為圖像
images = convert_from_path(pdf_file, first_page=page_num+1, last_page=page_num+1)
# 定義圖像保存路徑
filename = os.path.splitext(os.path.basename(pdf_file))[0]
image_path = os.path.join(pdf_dir, f"{filename}_page_{page_num+1}.jpg")
# 保存圖像
for i, image in enumerate(images):
if i == 0:
image.save(image_path, "JPEG")
else:
image_path = os.path.join(pdf_dir, f"{filename}_page_{page_num+1}_{i+1}.jpg")
image.save(image_path, "JPEG")
# 關(guān)閉PDF文件
pdf.close()第二種是點擊運行后,彈出窗口選擇PDF所在文件夾,程序運行對該文件夾下的所有PDF文件轉(zhuǎn)換成圖片
#手動選擇目錄下的pdf文件
import os
from tkinter import Tk
from tkinter.filedialog import askdirectory
from PyPDF2 import PdfReader
from pdf2image import convert_from_path
# 打開選擇目錄的對話框
Tk().withdraw() # 隱藏Tkinter根窗口
pdf_dir = askdirectory(title="選擇PDF所在目錄")
# 遍歷目錄中的PDF文件
pdf_files = [f for f in os.listdir(pdf_dir) if f.endswith(".pdf")]
# 遍歷每個PDF文件,并將其轉(zhuǎn)換為圖片
for pdf_file in pdf_files:
# 創(chuàng)建PdfReader對象
pdf_path = os.path.join(pdf_dir, pdf_file)
pdf = open(pdf_path, 'rb')
pdf_reader = PdfReader(pdf)
# 遍歷PDF的頁面并將其轉(zhuǎn)換為圖片
for page_num in range(len(pdf_reader.pages)):
# 獲取頁面對象
page = pdf_reader.pages[page_num]
# 將PDF頁面轉(zhuǎn)換為圖像
images = convert_from_path(pdf_path, first_page=page_num+1, last_page=page_num+1)
# 定義圖像保存路徑
filename = os.path.splitext(pdf_file)[0]
image_path = os.path.join(pdf_dir, f"{filename}_page_{page_num+1}.jpg")
# 保存圖像
for i, image in enumerate(images):
if i == 0:
image.save(image_path, "JPEG")
else:
image_path = os.path.join(pdf_dir, f"{filename}_page_{page_num+1}_{i+1}.jpg")
image.save(image_path, "JPEG")
# 關(guān)閉PDF文件
pdf.close()到此這篇關(guān)于Python腳本實現(xiàn)將PDF批量轉(zhuǎn)換為圖片的文章就介紹到這了,更多相關(guān)Python PDF轉(zhuǎn)圖片內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- Python輕松實現(xiàn)將圖片轉(zhuǎn)換為PDF并合并
- Python批量實現(xiàn)PDF轉(zhuǎn)換為圖片(JPG/PNG)
- Python編程之PDF轉(zhuǎn)圖片的三種實現(xiàn)方法詳解
- 使用Python實現(xiàn)將圖片(JPG/PNG)轉(zhuǎn)換為PDF
- Python實現(xiàn)將PDF文檔轉(zhuǎn)換為圖片的示例代碼
- Python使用pdf2image實現(xiàn)PDF轉(zhuǎn)圖片的完整指南
- 利用Python實現(xiàn)文檔格式互轉(zhuǎn)的操作大全(PDF、Word、圖片、Markdown)
- 利用Python將PDF文件轉(zhuǎn)換為PNG圖片的代碼示例
相關(guān)文章
Django Admin中增加導(dǎo)出CSV功能過程解析
這篇文章主要介紹了Django Admin中增加導(dǎo)出CSV功能過程解析,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下2019-09-09
Python爬取動態(tài)網(wǎng)頁中圖片的完整實例
這篇文章主要給大家介紹了關(guān)于Python爬取動態(tài)網(wǎng)頁中圖片的相關(guān)資料,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2021-03-03
Python3通過chmod修改目錄或文件權(quán)限的方法示例
這篇文章主要介紹了Python3通過chmod修改目錄或文件權(quán)限的方法示例,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2020-06-06
python光學(xué)仿真PyQt5基礎(chǔ)框架教程
這篇文章主要為大家介紹了python光學(xué)仿真之PyQt5基礎(chǔ)框架教程,文中含有詳細實現(xiàn)示例解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助2021-10-10
在Python中使用swapCase()方法轉(zhuǎn)換大小寫的教程
這篇文章主要介紹了在Python中使用swapCase()方法轉(zhuǎn)換大小寫的教程,是Python入門中的基礎(chǔ)知識,需要的朋友可以參考下2015-05-05

