最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python使用docx模塊處理word文檔流程詳解

 更新時(shí)間:2023年05月19日 10:17:06   作者:魔王不會(huì)哭  
這篇文章主要介紹了Python使用docx模塊處理word文檔流程,docx模塊是用于創(chuàng)建和更新Microsoft Word文件的Python庫(kù),用于辦公可以顯著提升工作效率,感興趣的同學(xué)可以參考下文

一.docx模塊

Python可以利用python-docx模塊處理word文檔,處理方式是面向?qū)ο蟮摹?/p>

也就是說(shuō)python-docx模塊會(huì)把word文檔,文檔中的段落、文本、字體等都看做對(duì)象,對(duì)對(duì)象進(jìn)行處理就是對(duì)word文檔的內(nèi)容處理。

二.相關(guān)概念

如果需要讀取word文檔中的文字(一般來(lái)說(shuō),程序也只需要認(rèn)識(shí)word文檔中的文字信息),需要先了解python-docx模塊的幾個(gè)概念。

  • Document對(duì)象,表示一個(gè)word文檔。
  • Paragraph對(duì)象,表示word文檔中的一個(gè)段落
  • Paragraph對(duì)象的text屬性,表示段落中的文本內(nèi)容。

三.模塊的安裝和導(dǎo)入

需要注意,python-docx模塊安裝需要在cmd命令行中輸入pip install python-docx,

如下圖表示安裝成功(最后那句英文Successfully installed,成功地安裝完成)

注意:在導(dǎo)入模塊時(shí),用的是import docx。

四.讀取word文本

在了解了上面的信息之后,就很簡(jiǎn)單了,

下面先創(chuàng)建一個(gè)D:\temp\word.docx文件,并在其中輸入如下內(nèi)容。

import docx
file=docx.Document(r"F:\python從入門(mén)到放棄\7\2\wenjian.docx")
print('段落:'+str(len(file.paragraphs)))
# 
# for para in file.paragraphs:
#     print(para.text)
for i in range(len(file.paragraphs)): 
    print("第"+str(i)+"段的內(nèi)容是:"+file.paragraphs[i].text)  
import sys
from docx import Document
from docx.shared import Inches
def main():
#     reload(sys)
#     sys.setdefaultencoding('utf-8')
    # 創(chuàng)建文檔對(duì)象
    document = Document()
    # 設(shè)置文檔標(biāo)題,中文要用unicode字符串
    document.add_heading(u'我的一個(gè)新文檔',0)
    # 往文檔中添加段落
    p = document.add_paragraph('This is a paragraph having some ')
    p.add_run('bold ').bold = True
    p.add_run('and some ')
    p.add_run('italic.').italic = True
    # 添加一級(jí)標(biāo)題
    document.add_heading(u'一級(jí)標(biāo)題, level = 1',level = 1)
    document.add_paragraph('Intense quote',style = 'IntenseQuote')
    # 添加無(wú)序列表
    document.add_paragraph('first item in unordered list',style = 'ListBullet')
    # 添加有序列表
    document.add_paragraph('first item in ordered list',style = 'ListNumber')
    document.add_paragraph('second item in ordered list',style = 'ListNumber')
    document.add_paragraph('third item in ordered list',style = 'ListNumber')
    # 添加圖片,并指定寬度
    document.add_picture('cat.png',width = Inches(2.25))
    # 添加表格: 1行3列
    table = document.add_table(rows = 1,cols = 3)
    # 獲取第一行的單元格列表對(duì)象
    hdr_cells = table.rows[0].cells
    # 為每一個(gè)單元格賦值
    # 注:值都要為字符串類型
    hdr_cells[0].text = 'Name'
    hdr_cells[1].text = 'Age'
    hdr_cells[2].text = 'Tel'
    # 為表格添加一行
    new_cells = table.add_row().cells
    new_cells[0].text = 'Tom'
    new_cells[1].text = '19'
    new_cells[2].text = '12345678'
    # 添加分頁(yè)符
    document.add_page_break()
    # 往新的一頁(yè)中添加段落
    p = document.add_paragraph('This is a paragraph in new page.')
    # 保存文檔
    document.save('demo1.doc')
if __name__ == '__main__':
    main()

讀取表格:

import docx
doc = docx.Document('wenjian.docx')
for table in doc.tables:  # 遍歷所有表格
    print('----table------')
    for row in table.rows:  # 遍歷表格的所有行
        # row_str = '\t'.join([cell.text for cell in row.cells])  # 一行數(shù)據(jù)
        # print row_str
        for cell in row.cells:
            print(cell.text, '\t',)
        print() #換行

首先是用docx.Document打開(kāi)對(duì)應(yīng)的文件目錄。

docx文件的結(jié)構(gòu)比較復(fù)雜,分為三層,

  • Docment對(duì)象表示整個(gè)文檔;
  • Docment包含了Paragraph對(duì)象的列表,Paragraph對(duì)象用來(lái)表示文檔中的段落;
  • 一個(gè)Paragraph對(duì)象包含Run對(duì)象的列表。

因此p.text會(huì)打印出整個(gè)的文本文檔。而用doc.tables來(lái)遍歷所有的表格。

并且對(duì)每個(gè)表格通過(guò)遍歷行,列的方式來(lái)得到所有的內(nèi)容。

但是在運(yùn)行結(jié)果中并沒(méi)有找到我們插入的文件對(duì)象和圖片,text.txt文檔。

這部分該如何解析呢?

首先我們需要先來(lái)認(rèn)識(shí)下docx文檔的格式組成:

docx是Microsoft Office2007之后版本使用的,

用新的基于XML的壓縮文件格式取代了其目前專有的默認(rèn)文件格式,

在傳統(tǒng)的文件名擴(kuò)展名后面添加了字母“x”

(即“.docx”取代“.doc”、“.xlsx”取代“.xls”、“.pptx”取代“.ppt”)。

docx格式的文件本質(zhì)上是一個(gè)ZIP文件。

將一個(gè)docx文件的后綴改為ZIP后是可以用解壓工具打開(kāi)或是解壓的。

事實(shí)上,Word2007的基本文件就是ZIP格式的,他可以算作是docx文件的容器。

docx 格式文件的主要內(nèi)容是保存為XML格式的,但文件并非直接保存于磁盤(pán)。

它是保存在一個(gè)ZIP文件中,然后取擴(kuò)展名為docx。

將.docx 格式的文件后綴改為ZIP后解壓,

可以看到解壓出來(lái)的文件夾中有word這樣一個(gè)文件夾,

它包含了Word文檔的大部分內(nèi)容。

而其中的document.xml文件則包含了文檔的主要文本內(nèi)容

從上面的文檔我們可以了解到docx文檔實(shí)際上是由XML文檔打包組成的。

那么我們要得到其中所有的部分,可以用ZIP解壓的方式來(lái)得到所有的部件。

我們先試下看是否可以

1 將docx文檔改成ZIP的后綴

2 解壓文件

解壓之后得到如下幾個(gè)文件

點(diǎn)開(kāi)word文件夾:有如下的文件夾。

document.xml就是描述文本對(duì)象的文件

其中embeddings文件中就是我們插入的文本對(duì)象text.txt. 是一個(gè)bin文件

Media文件中就是存儲(chǔ)的圖片:

我們通過(guò)手動(dòng)的方式將插入的文本以及圖片解析出來(lái),那么通過(guò)代碼也是同樣可以解析的。

代碼如下:

os.chdir(r'E:\py_prj')  #首先改變目錄到文件的目錄
os.rename('test.docx','test.ZIP')  # 重命名為zip文件
f=zipfile.ZipFile('test.zip','r')  #進(jìn)行解壓
for file in f.namelist():
    f.extract(file)
file=open(r'E:\py_prj\word\embeddings\oleObject1.bin','rb').read() #進(jìn)入文件路徑,讀取二進(jìn)制文件。
for f in file:
    print (f)

通過(guò)上面的方式,就可以將docx中插入的文件以及圖片全部解析出來(lái)。

具體docx的寫(xiě)的方式可以參考官方文檔的介紹

到此這篇關(guān)于Python使用docx模塊處理word文檔流程詳解的文章就介紹到這了,更多相關(guān)Python docx模塊處理word文檔內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python實(shí)現(xiàn)得到一個(gè)給定類的虛函數(shù)

    python實(shí)現(xiàn)得到一個(gè)給定類的虛函數(shù)

    這篇文章主要介紹了python實(shí)現(xiàn)得到一個(gè)給定類的虛函數(shù)的方法,以wx的PyPanel類為例講述了打印以base_開(kāi)頭的方法的實(shí)例,需要的朋友可以參考下
    2014-09-09
  • python調(diào)用可執(zhí)行文件.exe的2種實(shí)現(xiàn)方法

    python調(diào)用可執(zhí)行文件.exe的2種實(shí)現(xiàn)方法

    Python是一種流行的編程語(yǔ)言,可以輕松地通過(guò)腳本調(diào)用各種應(yīng)用程序,本文就詳細(xì)的介紹了python調(diào)用可執(zhí)行文件.exe的2種實(shí)現(xiàn)方法,感興趣的可以了解一下
    2023-08-08
  • Python實(shí)現(xiàn)將列表導(dǎo)出為Excel文件

    Python實(shí)現(xiàn)將列表導(dǎo)出為Excel文件

    在 Python 數(shù)據(jù)處理場(chǎng)景中,將列表(List)數(shù)據(jù)導(dǎo)出為 Excel 文件是高頻需求,本文將演示如何用 Free Spire.XLS for Python 實(shí)現(xiàn)列表轉(zhuǎn) Excel,感興趣的小伙伴可以了解下
    2025-12-12
  • web自動(dòng)化測(cè)試Selenium點(diǎn)擊元素的常用方法

    web自動(dòng)化測(cè)試Selenium點(diǎn)擊元素的常用方法

    在Web自動(dòng)化測(cè)試中,Selenium提供多種點(diǎn)擊方法,常用的click()方法通過(guò)選中元素并觸發(fā)點(diǎn)擊事件,若click()方法不穩(wěn)定,可以采用JavaScript執(zhí)行點(diǎn)擊或使用ActionChains類模擬鼠標(biāo)點(diǎn)擊,需要的朋友可以參考下
    2024-09-09
  • 如何利用Python將html轉(zhuǎn)為pdf、word文件

    如何利用Python將html轉(zhuǎn)為pdf、word文件

    網(wǎng)絡(luò)上存在很多將HTML轉(zhuǎn)換為PDF的軟件和工具,但是大家都知道收費(fèi),所以下面這篇文章主要給大家介紹了關(guān)于如何利用Python將html轉(zhuǎn)為pdf、word文件的相關(guān)資料,文中通過(guò)示例代碼介紹介紹的非常詳細(xì),需要的朋友可以參考下
    2022-12-12
  • Pytorch抽取網(wǎng)絡(luò)層的Feature Map(Vgg)實(shí)例

    Pytorch抽取網(wǎng)絡(luò)層的Feature Map(Vgg)實(shí)例

    今天小編就為大家分享一篇Pytorch抽取網(wǎng)絡(luò)層的Feature Map(Vgg)實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2019-08-08
  • 詳解如何在Pandas中刪除常量列

    詳解如何在Pandas中刪除常量列

    常數(shù)列不提供可變性,這意味著它們無(wú)助于區(qū)分不同的數(shù)據(jù)點(diǎn),在許多機(jī)器學(xué)習(xí)模型中,這些列會(huì)引入冗余或不相關(guān)的數(shù)據(jù),從而對(duì)性能產(chǎn)生負(fù)面影響,因此,通常必須刪除常量列,所以本文我們將探索如何使用Python識(shí)別和刪除Pandas DataFrame中的常量列,需要的朋友可以參考下
    2025-03-03
  • Python中的CSV文件使用

    Python中的CSV文件使用"with"語(yǔ)句的方式詳解

    with語(yǔ)句的主要用法是對(duì)語(yǔ)句中使用的對(duì)象進(jìn)行異常安全的清除.確保文件已關(guān)閉,鎖定已釋放,上下文恢復(fù)等.本文通過(guò)實(shí)例代碼給大家介紹Python中的CSV文件使用"with"語(yǔ)句的相關(guān)知識(shí),感興趣的朋友一起看看吧
    2018-10-10
  • pytorch如何保存訓(xùn)練模型參數(shù)并實(shí)現(xiàn)繼續(xù)訓(xùn)練

    pytorch如何保存訓(xùn)練模型參數(shù)并實(shí)現(xiàn)繼續(xù)訓(xùn)練

    這篇文章主要介紹了pytorch如何保存訓(xùn)練模型參數(shù)并實(shí)現(xiàn)繼續(xù)訓(xùn)練問(wèn)題,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2023-09-09
  • Python?查看數(shù)據(jù)類型與格式

    Python?查看數(shù)據(jù)類型與格式

    這篇文章主要介紹了Python?查看數(shù)據(jù)類型與格式方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教
    2022-09-09

最新評(píng)論

康保县| 普兰店市| 利辛县| 肇东市| 蒙城县| 旌德县| 剑川县| 隆安县| 工布江达县| 木里| 南岸区| 东宁县| 辽宁省| 兖州市| 洱源县| 达日县| 新龙县| 文化| 金华市| 攀枝花市| 武义县| 太和县| 南投县| 赤水市| 库车县| 麻栗坡县| 富平县| 大渡口区| 溆浦县| 尉氏县| 蓬安县| 全椒县| 泰州市| 靖宇县| 贵港市| 福鼎市| 高安市| 大兴区| 格尔木市| 武穴市| 盐亭县|