Python提取PDF表格數(shù)據(jù)并導(dǎo)出為TXT、Excel?格式
在數(shù)據(jù)處理與辦公自動(dòng)化場(chǎng)景中,PDF 表格因格式穩(wěn)定被廣泛使用,但不可直接編輯的特性,給數(shù)據(jù)統(tǒng)計(jì)、分析和二次加工帶來(lái)諸多不便。手動(dòng)復(fù)制粘貼不僅效率低下,還容易出現(xiàn)數(shù)據(jù)錯(cuò)位、遺漏等問(wèn)題。
本文將分享一種高效的解決方案—基于Python結(jié)合Spire系列庫(kù),實(shí)現(xiàn) PDF 表格數(shù)據(jù)的精準(zhǔn)提取,并分別導(dǎo)出為 TXT 文本和 Excel 表格格式。該方案無(wú)需復(fù)雜的正則表達(dá)式或OCR識(shí)別,代碼簡(jiǎn)潔易上手,適合批量處理各類PDF表格文件。
一、準(zhǔn)備工作:安裝所需 Python 庫(kù)
本次實(shí)戰(zhàn)需要兩個(gè)核心庫(kù),分別負(fù)責(zé) PDF 表格提取和 Excel 文件生成,功能分工明確:
- Spire.PDF for Python:一款輕量級(jí) PDF 處理庫(kù),支持直接識(shí)別 PDF 中的表格結(jié)構(gòu),精準(zhǔn)提取單元格數(shù)據(jù),無(wú)需依賴額外的 OCR 工具。
- Spire.XLS for Python:專業(yè)的 Excel 操作庫(kù),可實(shí)現(xiàn) Excel 文件的創(chuàng)建、數(shù)據(jù)寫入、格式優(yōu)化等功能,完美適配各類 Excel 版本。
打開(kāi)命令行終端,執(zhí)行以下pip命令完成安裝(建議在虛擬環(huán)境中操作,避免版本沖突):
pip install Spire.PDF pip install Spire.XLS
二、實(shí)戰(zhàn)1:提取 PDF 表格數(shù)據(jù)到 TXT 文件
TXT 文件具有體積小、兼容性強(qiáng)的特點(diǎn),適合快速查看和傳輸數(shù)據(jù)。使用 Spire.PDF for Python 提取數(shù)據(jù)并寫入 TXT 的核心邏輯,是按頁(yè)面→表格→行→列的層級(jí)遍歷 PDF 內(nèi)容,最終將數(shù)據(jù)格式化輸出。
實(shí)現(xiàn)步驟拆解
- 加載 PDF 文檔:通過(guò)
PdfDocument類的LoadFromFile()方法讀取目標(biāo) PDF 文件,支持相對(duì)路徑和絕對(duì)路徑。 - 初始化提取工具:創(chuàng)建
PdfTableExtractor對(duì)象,用于識(shí)別并提取 PDF 頁(yè)面中的表格數(shù)據(jù)。 - 層級(jí)遍歷數(shù)據(jù):依次遍歷 PDF 的每一頁(yè)、每頁(yè)中的每個(gè)表格、表格的每一行和每一列,通過(guò)
GetText(rowIndex, columnIndex)方法獲取單元格文本。 - 寫入 TXT 文件:將提取的數(shù)據(jù)按“列用空格分隔、行用換行分隔”的格式整理,寫入TXT文件并指定 UTF-8 編碼,避免中文亂碼。
完整代碼示例(含詳細(xì)注釋)
from spire.pdf.common import *
from spire.pdf import *
# 1. 加載PDF文檔,替換為你的目標(biāo)PDF文件路徑
pdf_doc = PdfDocument()
pdf_doc.LoadFromFile("表格.pdf")
# 2. 創(chuàng)建列表存儲(chǔ)提取的數(shù)據(jù),便于后續(xù)拼接
data_list = []
# 3. 初始化表格提取器
table_extractor = PdfTableExtractor(pdf_doc)
# 4. 遍歷PDF的每一頁(yè)
for page_idx in range(pdf_doc.Pages.Count):
# 提取當(dāng)前頁(yè)面的所有表格
tables = table_extractor.ExtractTable(page_idx)
# 判斷當(dāng)前頁(yè)面是否存在表格,避免空指針異常
if tables is not None and len(tables) > 0:
# 遍歷每個(gè)表格
for table in tables:
row_num = table.GetRowCount() # 獲取表格總行數(shù)
col_num = table.GetColumnCount() # 獲取表格總列數(shù)
# 遍歷表格的每一行
for i in range(row_num):
row_data = []
# 遍歷該行的每一列
for j in range(col_num):
# 獲取單元格文本
cell_text = table.GetText(i, j)
row_data.append(cell_text)
# 用空格分隔列數(shù)據(jù),拼接成一行
data_list.append(" ".join(row_data))
# 不同表格之間添加空行,區(qū)分?jǐn)?shù)據(jù)邊界
data_list.append("")
# 5. 將數(shù)據(jù)寫入TXT文件
with open("提取PDF表格.txt", "w", encoding="utf-8") as f:
f.write("\n".join(data_list))
# 6. 釋放資源,避免內(nèi)存占用
pdf_doc.Close()
三、實(shí)戰(zhàn)2:提取 PDF 表格數(shù)據(jù)到 Excel 文件
Excel 文件支持?jǐn)?shù)據(jù)篩選、公式計(jì)算、圖表生成等高級(jí)功能,是數(shù)據(jù)分析的首選格式。本示例需要結(jié)合 Spire.PDF for Python 和 Spire.XLS for Python,在提取數(shù)據(jù)的基礎(chǔ)上,實(shí)現(xiàn) Excel 文件的創(chuàng)建和數(shù)據(jù)寫入。
實(shí)現(xiàn)步驟拆解
數(shù)據(jù)提取的步驟與 TXT 示例一致,額外增加 Excel 文件操作的3個(gè)核心步驟:
- 創(chuàng)建Excel工作簿:實(shí)例化
Workbook對(duì)象,清空默認(rèn)工作表,為后續(xù)添加新表格做準(zhǔn)備。 - 數(shù)據(jù)寫入單元格:Excel 的行列索引從1開(kāi)始(與Python的0索引不同),因此需要將表格的行、列索引分別+1,確保數(shù)據(jù)寫入正確位置。
- 優(yōu)化表格格式:調(diào)用
AutoFitColumns()方法設(shè)置列寬自適應(yīng)內(nèi)容,提升表格可讀性,最后保存為指定版本的Excel文件。
完整代碼示例(含詳細(xì)注釋)
from spire.pdf import *
from spire.xls import *
# 1. 加載PDF文檔
pdf_doc = PdfDocument()
pdf_doc.LoadFromFile("表格.pdf")
# 2. 創(chuàng)建Excel工作簿并清空默認(rèn)工作表
excel_workbook = Workbook()
excel_workbook.Worksheets.Clear()
# 3. 初始化表格提取器
table_extractor = PdfTableExtractor(pdf_doc)
# 4. 工作表編號(hào),用于命名新工作表
sheet_index = 1
# 5. 遍歷PDF的每一頁(yè)
for page_idx in range(pdf_doc.Pages.Count):
tables = table_extractor.ExtractTable(page_idx)
if tables is not None and len(tables) > 0:
# 遍歷當(dāng)前頁(yè)面的每個(gè)表格
for table in tables:
# 創(chuàng)建新工作表,命名為“sheet+編號(hào)”
worksheet = excel_workbook.Worksheets.Add(f"sheet{sheet_index}")
row_num = table.GetRowCount()
col_num = table.GetColumnCount()
# 遍歷表格單元格
for i in range(row_num):
for j in range(col_num):
cell_text = table.GetText(i, j)
# Excel索引從1開(kāi)始,需將i和j分別+1
worksheet.Range[i + 1, j + 1].Value = cell_text
# 設(shè)置列寬自適應(yīng)內(nèi)容,優(yōu)化顯示效果
worksheet.AllocatedRange.AutoFitColumns()
# 工作表編號(hào)遞增
sheet_index += 1
# 6. 保存Excel文件,指定保存路徑和Excel版本
excel_workbook.SaveToFile("導(dǎo)出PDF表格到Excel.xlsx", ExcelVersion.Version2016)
# 7. 釋放資源
pdf_doc.Close()
excel_workbook.Dispose()
四、關(guān)鍵注意事項(xiàng)
文件路徑問(wèn)題:若運(yùn)行代碼時(shí)提示“文件不存在”,請(qǐng)檢查 PDF 文件路徑是否正確,建議使用絕對(duì)路徑(如 C:/data/表格.pdf)避免路徑錯(cuò)誤。
中文亂碼處理:寫入 TXT 文件時(shí),務(wù)必指定 encoding="utf-8";導(dǎo)出 Excel 文件時(shí),Spire.XLS for Python 默認(rèn)支持中文,無(wú)需額外配置。
資源釋放:使用 Close() 和 Dispose() 方法釋放 PDF 和 Excel 對(duì)象,避免長(zhǎng)時(shí)間運(yùn)行導(dǎo)致內(nèi)存泄漏。
五、總結(jié)
基于Spire系列庫(kù),能夠快速實(shí)現(xiàn) PDF 表格數(shù)據(jù)的提取與格式轉(zhuǎn)換,相比傳統(tǒng)的手動(dòng)操作,效率提升數(shù)十倍。該方案適用于各類場(chǎng)景,如批量提取財(cái)務(wù)報(bào)表、科研數(shù)據(jù)、政務(wù)文件中的 PDF 表格,為數(shù)據(jù)自動(dòng)化處理提供了可靠的技術(shù)支撐。
到此這篇關(guān)于Python提取PDF表格數(shù)據(jù)并導(dǎo)出為TXT、Excel 格式的文章就介紹到這了,更多相關(guān)Python提取PDF表格數(shù)據(jù)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- 使用Python將Word文檔導(dǎo)出為PDF格式并從Word文檔中提取數(shù)據(jù)
- Python利用pdfplumber提取PDF文檔中的表格數(shù)據(jù)并導(dǎo)出
- Python利用pdfplumber庫(kù)提取pdf中表格數(shù)據(jù)
- 如何利用Python提取pdf中的表格數(shù)據(jù)(附實(shí)戰(zhàn)案例)
- python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中
- python?pdfplumber庫(kù)批量提取pdf表格數(shù)據(jù)轉(zhuǎn)換為excel
- python從PDF中提取數(shù)據(jù)的示例
- Python 用三行代碼提取PDF表格數(shù)據(jù)
相關(guān)文章
如何在Django中設(shè)置定時(shí)任務(wù)的方法示例
這篇文章主要介紹了如何在Django中設(shè)置定時(shí)任務(wù)的方法示例,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧2019-01-01
python實(shí)現(xiàn)學(xué)員管理系統(tǒng)
這篇文章主要為大家詳細(xì)介紹了python實(shí)現(xiàn)學(xué)員管理系統(tǒng),文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2019-02-02
Python實(shí)現(xiàn)繪制圣誕樹(shù)和煙花的示例代碼
這不是圣誕節(jié)快到了,還不用Python繪制個(gè)圣誕樹(shù)和煙花讓女朋友開(kāi)心開(kāi)心,也算是親手做的,稍稍花了點(diǎn)心思,學(xué)會(huì)了趕緊畫給你的那個(gè)她吧2022-12-12
Python實(shí)現(xiàn)一個(gè)簡(jiǎn)單的驗(yàn)證碼程序
這篇文章主要介紹了Python實(shí)現(xiàn)一個(gè)簡(jiǎn)單的驗(yàn)證碼程序,具有一定參考價(jià)值,需要的朋友可以了解下。2017-11-11
舉例簡(jiǎn)單講解Python中的數(shù)據(jù)存儲(chǔ)模塊shelve的用法
這篇文章主要介紹了舉例簡(jiǎn)單講解Python中的數(shù)據(jù)存儲(chǔ)模塊shelve的用法,shelveshelve模塊與pickle模塊的功能相近,比pickle用起來(lái)更為簡(jiǎn)單,需要的朋友可以參考下2016-03-03
Python操作Access數(shù)據(jù)庫(kù)基本步驟分析
這篇文章主要介紹了Python操作Access數(shù)據(jù)庫(kù)基本步驟,結(jié)合實(shí)例形式詳細(xì)分析了Python針對(duì)access操作的具體步驟與相關(guān)注意事項(xiàng),需要的朋友可以參考下2016-09-09
Python實(shí)現(xiàn)獲取Windows設(shè)備信息
這篇文章主要為大家詳細(xì)介紹了如何在Python中獲取設(shè)備網(wǎng)絡(luò)標(biāo)識(shí)(MAC地址)的方法,文中的示例代碼講解詳細(xì),感興趣的小伙伴可以了解下2026-04-04
python之驗(yàn)證碼生成(gvcode與captcha)
這篇文章主要介紹了python之驗(yàn)證碼生成(gvcode與captcha),小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧2019-01-01

