最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python 3.6 中使用pdfminer解析pdf文件的實(shí)現(xiàn)

 更新時(shí)間:2019年09月25日 11:13:54   作者:W-大泡泡  
這篇文章主要介紹了Python 3.6 中使用pdfminer解析pdf文件的實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧

所使用python環(huán)境為最新的3.6版本

一、安裝pdfminer模塊

安裝anaconda后,直接可以通過pip安裝

pip install pdfminer3k

這里寫圖片描述 

如上圖所示安裝成功。

二、在IDE中進(jìn)行編碼

#!/usr/bin/env python
# encoding: utf-8

"""
@author: wugang
@software: PyCharm
@file: prase_pdf.py
@time: 2017/3/3 0003 11:16
"""
import sys
import importlib
importlib.reload(sys)

from pdfminer.pdfparser import PDFParser,PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LTTextBoxHorizontal,LAParams
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed

'''
 解析pdf 文本,保存到txt文件中
'''
path = r'../../data/pdf/阿里巴巴Java開發(fā)規(guī)范手冊.pdf'
def parse():
  fp = open(path, 'rb') # 以二進(jìn)制讀模式打開
  #用文件對象來創(chuàng)建一個(gè)pdf文檔分析器
  praser = PDFParser(fp)
  # 創(chuàng)建一個(gè)PDF文檔
  doc = PDFDocument()
  # 連接分析器 與文檔對象
  praser.set_document(doc)
  doc.set_parser(praser)

  # 提供初始化密碼
  # 如果沒有密碼 就創(chuàng)建一個(gè)空的字符串
  doc.initialize()

  # 檢測文檔是否提供txt轉(zhuǎn)換,不提供就忽略
  if not doc.is_extractable:
    raise PDFTextExtractionNotAllowed
  else:
    # 創(chuàng)建PDf 資源管理器 來管理共享資源
    rsrcmgr = PDFResourceManager()
    # 創(chuàng)建一個(gè)PDF設(shè)備對象
    laparams = LAParams()
    device = PDFPageAggregator(rsrcmgr, laparams=laparams)
    # 創(chuàng)建一個(gè)PDF解釋器對象
    interpreter = PDFPageInterpreter(rsrcmgr, device)

    # 循環(huán)遍歷列表,每次處理一個(gè)page的內(nèi)容
    for page in doc.get_pages(): # doc.get_pages() 獲取page列表
      interpreter.process_page(page)
      # 接受該頁面的LTPage對象
      layout = device.get_result()
      # 這里layout是一個(gè)LTPage對象 里面存放著 這個(gè)page解析出的各種對象 一般包括LTTextBox, LTFigure, LTImage, LTTextBoxHorizontal 等等 想要獲取文本就獲得對象的text屬性,
      for x in layout:
        if (isinstance(x, LTTextBoxHorizontal)):
          with open(r'../../data/pdf/1.txt', 'a') as f:
            results = x.get_text()
            print(results)
            f.write(results + '\n')

if __name__ == '__main__':
  parse()

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python文件操作基礎(chǔ)及異常處理

    Python文件操作基礎(chǔ)及異常處理

    這篇文章主要介紹了文件操作的基本方法,包括如何打開和關(guān)閉文件、使用with語句管理文件、讀取和寫入文件內(nèi)容、處理文件異常、進(jìn)行二進(jìn)制文件操作以及文件路徑的說明,,需要的朋友可以參考下
    2025-03-03
  • python3 寫一個(gè)WAV音頻文件播放器的代碼

    python3 寫一個(gè)WAV音頻文件播放器的代碼

    本文通過實(shí)例代碼給大家介紹了python3 寫一個(gè)WAV音頻文件播放器,代碼簡單易懂,非常不錯(cuò),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2019-09-09
  • 一文詳解pygame.sprite的精靈碰撞

    一文詳解pygame.sprite的精靈碰撞

    精靈其實(shí)在一個(gè)游戲程序中,精靈本質(zhì)指的是一張張小尺寸的圖片,比如游戲中的各種道具、人物、場景裝飾等,它們都可以看做成一張張小的“精靈”圖,下面這篇文章主要給大家介紹了關(guān)于pygame.sprite精靈碰撞的相關(guān)資料,需要的朋友可以參考下
    2023-01-01
  • python之pandas用法大全

    python之pandas用法大全

    本文講解了python的pandas基本用法,大家可以參考下
    2018-03-03
  • python實(shí)現(xiàn)四舍五入方式

    python實(shí)現(xiàn)四舍五入方式

    這篇文章主要介紹了python實(shí)現(xiàn)四舍五入方式,具有很好的參考價(jià)值,希望對大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2023-01-01
  • 一文帶你安裝opencv與常用庫(保姆級教程)

    一文帶你安裝opencv與常用庫(保姆級教程)

    Python OpenCV是一種流行的計(jì)算機(jī)視覺庫,使用它可以進(jìn)行圖像處理、視頻處理等操作,下面這篇文章主要給大家介紹了關(guān)于安裝opencv與常用庫的相關(guān)資料,需要的朋友可以參考下
    2023-05-05
  • 本機(jī)安裝PaddlePaddle安裝指南及步驟詳解

    本機(jī)安裝PaddlePaddle安裝指南及步驟詳解

    PaddlePaddle是百度研發(fā)的開源開放的深度學(xué)習(xí)平臺(tái),有全面的官方支持的工業(yè)級應(yīng)用模型,涵蓋自然語言處理、計(jì)算機(jī)視覺、推薦引擎等多個(gè)領(lǐng)域,并開放多個(gè)領(lǐng)先的預(yù)訓(xùn)練中文模型。這篇文章主要介紹了本機(jī)安裝PaddlePaddle安裝指南,需要的朋友可以參考下
    2021-12-12
  • 詳解 Python 讀寫XML文件的實(shí)例

    詳解 Python 讀寫XML文件的實(shí)例

    這篇文章主要介紹了詳解 Python 讀寫XML文件的實(shí)例的相關(guān)資料,Python 生成XML文件和Python 讀取XML 的實(shí)例,需要的朋友可以參考下
    2017-08-08
  • Python?Pandas中DataFrame.drop_duplicates()刪除重復(fù)值詳解

    Python?Pandas中DataFrame.drop_duplicates()刪除重復(fù)值詳解

    在實(shí)際處理數(shù)據(jù)中,數(shù)據(jù)預(yù)處理操作中,常常需要去除掉重復(fù)的數(shù)據(jù),這篇文章主要給大家介紹了關(guān)于Python?Pandas中DataFrame.drop_duplicates()刪除重復(fù)值的相關(guān)資料,需要的朋友可以參考下
    2022-07-07
  • python用glob模塊匹配路徑的方法詳解

    python用glob模塊匹配路徑的方法詳解

    這篇文章主要介紹了python如何用glob模塊匹配路徑,glob模塊是Python的一個(gè)標(biāo)準(zhǔn)庫,用于在文件系統(tǒng)中查找文件名匹配特定模式的文件路徑,需要的朋友可以參考下
    2024-02-02

最新評論

东明县| 南靖县| 杨浦区| 内乡县| 德安县| 康平县| 陇南市| 孝昌县| 博客| 平武县| 五大连池市| 亳州市| 专栏| 万安县| 安新县| 天台县| 武鸣县| 新疆| 庐江县| 呼图壁县| 三穗县| 黎城县| 南丰县| 安福县| 泌阳县| 襄城县| 舞阳县| 湘潭市| 申扎县| 大厂| 维西| 民勤县| 宜州市| 娄底市| 湖北省| 灌南县| 枞阳县| 威宁| 渝北区| 临高县| 沐川县|