最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python利用pdfplumber實現(xiàn)讀取PDF寫入Excel

 更新時間:2022年06月13日 09:14:46   作者:小袁ITSuper  
pdfplumber專注PDF內(nèi)容提取,例如文本(位置、字體及顏色等)和形狀(矩形、直線、曲線),還有解析表格的功能。本文主要為大家介紹如何利用pdfplumber實現(xiàn)讀取PDF寫入Excel,需要的可以參考一下

一、Python操作PDF 13大庫對比

PDF(Portable Document Format)是一種便攜文檔格式,便于跨操作系統(tǒng)傳播文檔。PDF文檔遵循標準格式,因此存在很多可以操作PDF文檔的工具,Python自然也不例外。

Python操作PDF模塊對比圖如下:

本文主要介紹pdfplumber專注PDF內(nèi)容提取,例如文本(位置、字體及顏色等)和形狀(矩形、直線、曲線),還有解析表格的功能。

二、pdfplumber模塊

其他幾個 Python 庫幫助用戶從 PDF 中提取信息。作為一個廣泛的概述,pdfplumber它通過結合以下功能將自己與其他 PDF 處理庫區(qū)分開來:

  • 輕松訪問有關每個 PDF 對象的詳細信息
  • 用于提取文本和表格的更高級別、可自定義的方法
  • 緊密集成的可視化調(diào)試
  • 其他有用的實用功能,例如通過裁剪框過濾對象 1.

1.安裝

cmd控制臺輸入:

pip install pdfplumber

導包:

import pdfplumber

案例PDF截圖(兩頁未截全):

2. 加載PDF

讀取PDF代碼:pdfplumber.open("路徑/文件名.pdf", password = "test", laparams = { "line_overlap": 0.7 })

參數(shù)解讀:

  • password :要加載受密碼保護的 PDF,請傳遞password關鍵字參數(shù)
  • laparams:要將布局分析參數(shù)設置為pdfminer.six的布局引擎,請傳遞laparams關鍵字參數(shù)

案例代碼:

import pdfplumber

with pdfplumber.open("./1.pdf") as pdf:
    print(pdf)
    print(type(pdf))

輸出結果:

<pdfplumber.pdf.PDF object at 0x000001A56C323DC0>
<class 'pdfplumber.pdf.PDF'>

3. pdfplumber.PDF類

pdfplumber.PDF類表示單個 PDF,并具有兩個主要屬性:

屬性 說明
.metadata從PDF的Info中獲取元數(shù)據(jù)鍵 /值對字典。 通常包括“ CreationDate”,“ ModDate”,“ Producer”等
.pages返回一個包含pdfplumber.Page實例的列表,每一個實例代表PDF每一頁的信息

1. 讀取PDF文檔信息(.metadata):

import pdfplumber

with pdfplumber.open("./1.pdf") as pdf:
    print(pdf.metadata)

運行結果:

{'Author': 'wangwangyuqing', 'Comments': '', 'Company': '', 'CreationDate': "D:20220330113508+03'35'", 'Creator': 'WPS 文字', 'Keywords': '', 'ModDate': "D:20220330113508+03'35'", 'Producer': '', 'SourceModified': "D:20220330113508+03'35'", 'Subject': '', 'Title': '', 'Trapped': 'False'}

2. 輸出總頁數(shù)

import pdfplumber

with pdfplumber.open("./1.pdf") as pdf:
    print(len(pdf.pages))

運行結果:

2

4. pdfplumber.Page類

pdfplumber.Page類是pdfplumber整個的核心,大多數(shù)操作都圍繞這個類進行操作,它具有以下幾個屬性:

屬性 說明
.page_number順序頁碼,從1第一頁開始,從第二頁開始2,依此類推
.width頁面的寬度
.height頁面的高度
.objects/.chars/.lines/.rects/.curves/.figures/.images這些屬性中的每一個都是一個列表,每個列表包含一個字典,用于嵌入頁面上的每個此類對象。有關詳細信息,請參閱下面的“對象”

常用方法如下

方法名 說明
.extract_text()用來提頁面中的文本,將頁面的所有字符對象整理為的那個字符串
.extract_words()返回的是所有的單詞及其相關信息
.extract_tables()提取頁面的表格
.to_image()用于可視化調(diào)試時,返回PageImage類的一個實例
.close()默認情況下,Page對象緩存其布局和對象信息,以避免重新處理它。但是,在解析大型 PDF 時,這些緩存的屬性可能需要大量內(nèi)存。您可以使用此方法刷新緩存并釋放內(nèi)存

方法名說明.extract_text()用來提頁面中的文本,將頁面的所有字符對象整理為的那個字符串.extract_words()返回的是所有的單詞及其相關信息.extract_tables()提取頁面的表格.to_image() 用于可視化調(diào)試時,返回PageImage類的一個實例.close()默認情況下,Page對象緩存其布局和對象信息,以避免重新處理它。但是,在解析大型 PDF 時,這些緩存的屬性可能需要大量內(nèi)存。您可以使用此方法刷新緩存并釋放內(nèi)存。

1. 讀取第一頁寬度、高度等信息

import pdfplumber

with pdfplumber.open("./1.pdf") as pdf:
    first_page = pdf.pages[0]  # pdfplumber.Page對象的第一頁
    # 查看頁碼
    print('頁碼:', first_page.page_number)
    # 查看頁寬
    print('頁寬:', first_page.width)
    # 查看頁高
    print('頁高:', first_page.height)

運行結果:

頁碼: 1
頁寬: 595.3
頁高: 841.9

2. 讀取文本第一頁

import pdfplumber

with pdfplumber.open("./1.pdf") as pdf:
    first_page = pdf.pages[0]  # pdfplumber.Page對象的第一頁
    text = first_page.extract_text()
    print(text)

運行結果:

店鋪名 價格 銷量 地址
小罐茶旗艦店 449 474 安徽
零趣食品旗艦店 6.9 60000 福建
天貓超市 1304 3961 上海
天貓超市 139 25000 上海
天貓超市 930 692 上海
天貓超市 980 495 上海
天貓超市 139 100000 上海
三只松鼠旗艦店 288 25000 安徽
紅小廚旗艦店 698 1767 北京
三只松鼠旗艦店 690 15000 安徽
一統(tǒng)領鮮旗艦店 1098 1580 上海
新大猩食品專營
9.8 7000 湖南
.......
艦店
蟹納旗艦店 498 1905 上海
三只松鼠堅果at茶 188 35000 安徽
嘉禹滬曉旗艦店 598 1517 上海

3. 讀取表格第一頁

import pdfplumber
import xlwt

with pdfplumber.open("1.pdf") as pdf:
    page_one = pdf.pages[0]  # PDF第一頁
    table_1 = page_one.extract_table()  # 讀取表格數(shù)據(jù)
    # 1. 創(chuàng)建Excel表對象
    workbook = xlwt.Workbook(encoding='utf8')
    # 2. 新建sheet表
    worksheet = workbook.add_sheet('Sheet1')
    # 3. 自定義列名
    col1 = table_1[0]
    # print(col1)# ['店鋪名', '價格', '銷量', '地址']
    # 4. 將列屬性元組col寫進sheet表單中第一行
    for i in range(0, len(col1)):
        worksheet.write(0, i, col1[i])
    # 5. 將數(shù)據(jù)寫進sheet表單中
    for i in range(0, len(table_1[1:])):
        data = table_1[1:][i]
        for j in range(0, len(col1)):
            worksheet.write(i + 1, j, data[j])
    # 6. 保存文件分兩種格式
    workbook.save('test.xls')

運行結果:

三、實戰(zhàn)操作

1. 提取單個PDF全部頁數(shù)

測試代碼:

import pdfplumber
import xlwt

with pdfplumber.open("1.pdf") as pdf:
    # 1. 把所有頁的數(shù)據(jù)存在一個臨時列表中
    item = []
    for page in pdf.pages:
        text = page.extract_table()
        for i in text:
            item.append(i)
    # 2. 創(chuàng)建Excel表對象
    workbook = xlwt.Workbook(encoding='utf8')
    # 3. 新建sheet表
    worksheet = workbook.add_sheet('Sheet1')
    # 4. 自定義列名
    col1 = item[0]
    # print(col1)# ['店鋪名', '價格', '銷量', '地址']
    # 5. 將列屬性元組col寫進sheet表單中第一行
    for i in range(0, len(col1)):
        worksheet.write(0, i, col1[i])
    # 6. 將數(shù)據(jù)寫進sheet表單中
    for i in range(0, len(item[1:])):
        data = item[1:][i]
        for j in range(0, len(col1)):
            worksheet.write(i + 1, j, data[j])
    # 7. 保存文件分兩種格式
    workbook.save('test.xls')

運行結果(上面得沒截全):

2. 批量提取多個PDF文件

測試代碼:

import pdfplumber
import xlwt
import os

# 一、獲取文件下所有pdf文件路徑
file_dir = r'E:\Python學習\pdf文件'
file_list = []
for files in os.walk(file_dir):
    # print(files)
    # ('E:\\Python學習\\pdf文件', [],
    #  ['1.pdf', '1的副本.pdf', '1的副本10.pdf', '1的副本11.pdf', '1的副本2.pdf', '1的副本3.pdf', '1的副本4.pdf', '1的副本5.pdf', '1的副本6.pdf',
    #   '1的副本7.pdf', '1的副本8.pdf', '1的副本9.pdf'])
    for file in files[2]:
        # 以. 進行分割如果后綴為PDF或pdf就拼接地址存入file_list
        if file.split(".")[1] == 'pdf' or file.split(".")[1] == 'PDF':
            file_list.append(file_dir + '\\' + file)

# 二、存入Excel
# 1. 把所有PDF文件的所有頁的數(shù)據(jù)存在一個臨時列表中
item = []
for file_path in file_list:
    with pdfplumber.open(file_path) as pdf:
        for page in pdf.pages:
            text = page.extract_table()
            for i in text:
                item.append(i)

# 2. 創(chuàng)建Excel表對象
workbook = xlwt.Workbook(encoding='utf8')
# 3. 新建sheet表
worksheet = workbook.add_sheet('Sheet1')
# 4. 自定義列名
col1 = item[0]
# print(col1)# ['店鋪名', '價格', '銷量', '地址']
# 5. 將列屬性元組col寫進sheet表單中第一行
for i in range(0, len(col1)):
    worksheet.write(0, i, col1[i])
# 6. 將數(shù)據(jù)寫進sheet表單中
for i in range(0, len(item[1:])):
    data = item[1:][i]
    for j in range(0, len(col1)):
        worksheet.write(i + 1, j, data[j])
# 7. 保存文件分兩種格式
workbook.save('test.xls')

運行結果(12個文件,一個文件50行總共600行):

以上就是Python利用pdfplumber實現(xiàn)讀取PDF寫入Excel的詳細內(nèi)容,更多關于Python pdfplumber讀取PDF寫入Excel的資料請關注腳本之家其它相關文章!

相關文章

  • 詳解解Django 多對多表關系的三種創(chuàng)建方式

    詳解解Django 多對多表關系的三種創(chuàng)建方式

    本文主要介紹了詳解解Django 多對多表關系的三種創(chuàng)建方式,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2021-08-08
  • 關于Python網(wǎng)絡爬蟲requests庫的介紹

    關于Python網(wǎng)絡爬蟲requests庫的介紹

    這篇文章主要介紹了關于Python網(wǎng)絡爬蟲requests庫,而很多時候這些數(shù)據(jù)存儲在網(wǎng)頁中,手動下載需要花費的時間太長,這時候我們就需要網(wǎng)絡爬蟲幫助我們自動爬取這些數(shù)據(jù),需要的朋友可以參考下
    2023-04-04
  • Python基于stuck實現(xiàn)scoket文件傳輸

    Python基于stuck實現(xiàn)scoket文件傳輸

    這篇文章主要介紹了Python基于stuck實現(xiàn)scoket文件傳輸,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-04-04
  • pandas DataFrame索引行列的實現(xiàn)

    pandas DataFrame索引行列的實現(xiàn)

    這篇文章主要介紹了pandas DataFrame索引行列的實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2019-06-06
  • 使用Python自動化Microsoft Excel和Word的操作方法

    使用Python自動化Microsoft Excel和Word的操作方法

    這篇文章主要介紹了使用Python自動化Microsoft Excel和Word,本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-04-04
  • keras得到每層的系數(shù)方式

    keras得到每層的系數(shù)方式

    這篇文章主要介紹了keras得到每層的系數(shù)方式,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-06-06
  • 淺析關于Keras的安裝(pycharm)和初步理解

    淺析關于Keras的安裝(pycharm)和初步理解

    Keras 是一個用 Python 編寫的高級神經(jīng)網(wǎng)絡 API,它能夠以 TensorFlow, CNTK, 或者 Theano 作為后端運行。這篇文章給大家介紹Keras的安裝(pycharm)和初步理解,感興趣的朋友一起看看吧
    2020-10-10
  • 基于python編寫監(jiān)控系統(tǒng)各項資源的腳本

    基于python編寫監(jiān)控系統(tǒng)各項資源的腳本

    這篇文章主要為大家詳細介紹了如何編寫一個python腳本,實現(xiàn)監(jiān)控網(wǎng)絡的流量、CPU使用率、內(nèi)存使用率和磁盤使用情況,感興趣的小伙伴可以了解下
    2023-11-11
  • Python連接Redis庫常見操作全面詳解

    Python連接Redis庫常見操作全面詳解

    本文將介紹如何在Python中進行Redis操作,包括連接Redis、數(shù)據(jù)存儲、數(shù)據(jù)檢索和其他常見操作,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2023-11-11
  • Python數(shù)據(jù)庫的連接實現(xiàn)方法與注意事項

    Python數(shù)據(jù)庫的連接實現(xiàn)方法與注意事項

    這篇文章主要介紹了Python數(shù)據(jù)庫的連接實現(xiàn)方法與注意事項,需要的朋友可以參考下
    2016-02-02

最新評論

瑞丽市| 婺源县| 寻乌县| 南澳县| 贡山| 开封县| 清苑县| 南木林县| 时尚| 九台市| 蒙自县| 磐石市| 寿宁县| 乐陵市| 无棣县| 牟定县| 内江市| 邛崃市| 峨眉山市| 涿鹿县| 外汇| 河北省| 西乌珠穆沁旗| 满洲里市| 遂川县| 沈丘县| 乐业县| 昌邑市| 清流县| 南皮县| 思茅市| 佛山市| 霍州市| 金秀| 奉节县| 上杭县| 高碑店市| 武安市| 成都市| 阜新市| 铜川市|