Python自動(dòng)化辦公之Word文件內(nèi)容的讀取
前言
前面幾個(gè)章節(jié)我們學(xué)習(xí)了對(duì)于普通文件的操作,比如說(shuō)文件的創(chuàng)建、復(fù)制粘貼、裁剪粘貼、文件名的重命名、刪除等等。另外還學(xué)習(xí)了一些基本練習(xí),如何查找文件、如何按照內(nèi)容查找文件等等。
在本章節(jié)及后續(xù),將開始學(xué)習(xí)一些特殊文件的自動(dòng)化相關(guān)操作。如 word、excel、PPT,雖然說(shuō)是特殊文件,其實(shí)也是實(shí)際工作中我們經(jīng)常會(huì)用到的文件類型。
接下來(lái)我們就進(jìn)入到 word 文件自動(dòng)化操作的學(xué)習(xí)內(nèi)容。
該章節(jié)涉及的新模塊
python-docx
pdfkit
pydocx
利用 python 批量讀取文件
word利器之python-docx
python-docx 是用于創(chuàng)建可修改 微軟 Word 的一個(gè) python 庫(kù),提供全套的 Word 操作,是最常用的 Word 工具。
使用前,先了解幾個(gè)概念:
- Document:是一個(gè) Word 文檔 對(duì)象,不同于 VBA 中 Worksheet 的概念,Document 是獨(dú)立的,打開不同的 Word 文檔,就會(huì)有不同的 Document 對(duì)象,相互之間沒(méi)有影響
- Paragraph:是段落,一個(gè) Word 文檔由多個(gè)段落組成,當(dāng)在文檔中輸入一個(gè)回車鍵,就會(huì)成為新的段落,輸入 shift + 回車,不會(huì)分段
- Run 表示一個(gè)節(jié)段,每個(gè)段落由多個(gè) 節(jié)段 組成,一個(gè)段落中具有相同樣式的連續(xù)文本,組成一個(gè)節(jié)段,所以一個(gè) 段落 對(duì)象有個(gè) Run 列表。
例如下圖的 word 文檔示意圖:

word 文檔結(jié)構(gòu)劃分如下:

python-docx 安裝
安裝:
pip install python-docx 如果安裝速度太慢的話,可以換一個(gè)國(guó)內(nèi)的源地址(如下)
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple python-docx
導(dǎo)入:
import docx
from docx import …
python-docx 之 Document
導(dǎo)入包與模塊:
from docx import Document
使用方法:
Document(word文件地址)
返回值:
word文件對(duì)象
python-docx 之段落內(nèi)容讀取
實(shí)際上要想讀取一個(gè) word 文檔,主要就是讀取它的段落以及它的表格。無(wú)論是段落還是表格,它的內(nèi)部都是字符串,我們的目的就是讀取這些字符串的內(nèi)容。
先看一下段落內(nèi)容的讀取方式:
來(lái)源:
document_obj.paragraphs 通過(guò) document 對(duì)象的 paragraphs 函數(shù)返回一個(gè)段落的列表;如果 word 文件存在多個(gè)段落,就會(huì)有多個(gè)段落對(duì)象。
使用方法:
通過(guò)循環(huán)獲取每個(gè)段落對(duì)象,并調(diào)用 text
演示案例腳本如下:
# coding:utf-8
import os
from docx import Document
path = os.path.join(os.getcwd(), 'test_file/文本.docx')
print("\'文本.docx\' 的路徑為:", path) # 調(diào)試路徑
doc = Document(path)
for p in doc.paragraphs:
print(p.text)
運(yùn)行結(jié)果如下:(PS:文本只是演示,本人非培訓(xùn)機(jī)構(gòu)的?。?/p>


python-docx 之表格內(nèi)容讀取
接下來(lái)我們看一下如何讀取 word 文件中的表格內(nèi)容:
來(lái)源:
document_obj.tables 通過(guò) document 對(duì)象的 paragraphs 函數(shù)返回一個(gè)表格的列表;里面是一個(gè)一個(gè)的表格的對(duì)象。
使用方法:
同樣通過(guò)循環(huán),獲取行與列的內(nèi)容
返回值:
每個(gè)表格字段(字符串)
演示案例代碼如下:
# coding:utf-8
import os
from docx import Document
path = os.path.join(os.getcwd(), 'test_file/文本.docx')
print("\'文本.docx\' 的路徑為:", path) # 調(diào)試路徑
doc = Document(path)
# for p in doc.paragraphs:
# print(p.text)
for t in doc.tables: # for 循環(huán)獲取表格對(duì)象
for row in t.rows: # 獲取每一行
row_str = []
for cell in row.cells: # 獲取每一行單獨(dú)的小表格,然后將其內(nèi)容拼接起來(lái);拼接完成之后再第二個(gè)for循環(huán)中打印出來(lái)
row_str.append(cell.text)
print(row_str)
# 也可以通過(guò) "columns" 獲取表格中的列的內(nèi)容,可以自己嘗試一下
運(yùn)行結(jié)果如下:

到此這篇關(guān)于Python自動(dòng)化辦公之Word文件內(nèi)容的讀取的文章就介紹到這了,更多相關(guān)Python讀取Word內(nèi)容內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
python numpy和list查詢其中某個(gè)數(shù)的個(gè)數(shù)及定位方法
今天小編就為大家分享一篇python numpy和list查詢其中某個(gè)數(shù)的個(gè)數(shù)及定位方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-06-06
mac安裝pytorch及系統(tǒng)的numpy更新方法
今天小編就為大家分享一篇mac安裝pytorch及系統(tǒng)的numpy更新方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-07-07
tensorflow: variable的值與variable.read_value()的值區(qū)別詳解
今天小編就為大家分享一篇tensorflow: variable的值與variable.read_value()的值區(qū)別詳解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-07-07
Python Numpy運(yùn)行報(bào)錯(cuò)IndexError與形狀不匹配的問(wèn)題解決辦法
在使用Numpy進(jìn)行數(shù)據(jù)處理和科學(xué)計(jì)算時(shí),IndexError和形狀不匹配(Shape Mismatch)是常見(jiàn)的錯(cuò)誤類型,這些錯(cuò)誤通常發(fā)生在數(shù)組索引操作、數(shù)組運(yùn)算或數(shù)組重塑時(shí),本文將通過(guò)一個(gè)具體的例子來(lái)詳細(xì)分析這些錯(cuò)誤的原因和解決辦法,需要的朋友可以參考下2024-07-07
python list多級(jí)排序知識(shí)點(diǎn)總結(jié)
在本篇文章里小編給大家分享的是關(guān)于python list多級(jí)排序的相關(guān)知識(shí)點(diǎn)內(nèi)容,有需要的朋友們學(xué)習(xí)下。2019-10-10
Python之Numpy的超實(shí)用基礎(chǔ)詳細(xì)教程
這篇文章主要介紹了Python之Numpy的超實(shí)用基礎(chǔ)詳細(xì)教程,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2019-10-10

