用Java輕松讀取Word文檔內(nèi)容的常用方法
前言
在 Java 開發(fā)里,有時候咱得讀取 Word 文檔里的內(nèi)容,這在處理合同、報告等文件時特別有用。咱可以根據(jù) Word 文檔的格式,用不同的庫來實現(xiàn)讀取功能。下面就詳細說說 .doc 和 .docx 這兩種常見格式文檔的讀取方法。
1. 讀取 .doc 格式的 Word 文檔
引入依賴
如果用 Maven 管理項目,在 pom.xml 里添加 Apache POI 的依賴:
<dependency>
<groupId>org.apache.poi</groupId>
<artifactId>poi-scratchpad</artifactId>
<version>5.2.3</version>
</dependency>代碼示例
import org.apache.poi.hwpf.HWPFDocument;
import org.apache.poi.hwpf.extractor.WordExtractor;
import java.io.FileInputStream;
import java.io.IOException;
public class ReadDocFile {
public static void main(String[] args) {
try (FileInputStream fis = new FileInputStream("example.doc")) {
// 創(chuàng)建 HWPFDocument 對象來表示 .doc 文檔
HWPFDocument document = new HWPFDocument(fis);
// 創(chuàng)建 WordExtractor 對象用于提取文檔內(nèi)容
WordExtractor extractor = new WordExtractor(document);
// 獲取文檔的文本內(nèi)容
String content = extractor.getText();
System.out.println(content);
} catch (IOException e) {
e.printStackTrace();
System.out.println("讀取 .doc 文件失?。? + e.getMessage());
}
}
}代碼解釋
FileInputStream fis = new FileInputStream("example.doc"):創(chuàng)建一個文件輸入流,用來讀取example.doc文件。HWPFDocument document = new HWPFDocument(fis):用HWPFDocument類創(chuàng)建一個文檔對象,它能處理.doc格式的文檔。WordExtractor extractor = new WordExtractor(document):創(chuàng)建WordExtractor對象,它可以從文檔對象里提取文本內(nèi)容。String content = extractor.getText():調(diào)用getText()方法獲取文檔的全部文本內(nèi)容,然后打印出來。
2. 讀取 .docx 格式的 Word 文檔
引入依賴
同樣在 pom.xml 里添加 Apache POI 的依賴:
<dependency>
<groupId>org.apache.poi</groupId>
<artifactId>poi-ooxml</artifactId>
<version>5.2.3</version>
</dependency>代碼示例
import org.apache.poi.xwpf.usermodel.XWPFDocument;
import org.apache.poi.xwpf.usermodel.XWPFParagraph;
import org.apache.poi.xwpf.usermodel.XWPFRun;
import java.io.FileInputStream;
import java.io.IOException;
public class ReadDocxFile {
public static void main(String[] args) {
try (FileInputStream fis = new FileInputStream("example.docx")) {
// 創(chuàng)建 XWPFDocument 對象來表示 .docx 文檔
XWPFDocument document = new XWPFDocument(fis);
StringBuilder content = new StringBuilder();
// 遍歷文檔中的每個段落
for (XWPFParagraph paragraph : document.getParagraphs()) {
// 遍歷段落中的每個文本運行對象
for (XWPFRun run : paragraph.getRuns()) {
content.append(run.getText(0));
}
content.append("\n");
}
System.out.println(content.toString());
} catch (IOException e) {
e.printStackTrace();
System.out.println("讀取 .docx 文件失?。? + e.getMessage());
}
}
}代碼解釋
FileInputStream fis = new FileInputStream("example.docx"):創(chuàng)建文件輸入流讀取example.docx文件。XWPFDocument document = new XWPFDocument(fis):用XWPFDocument類創(chuàng)建文檔對象,它專門處理.docx格式的文檔。通過兩層循環(huán),外層遍歷文檔里的每個段落,內(nèi)層遍歷段落里的每個文本運行對象,把文本內(nèi)容添加到
StringBuilder里,最后打印出來。
嘿,朋友們!有了上面的方法,咱就能用 Java 輕松讀取不同格式的 Word 文檔內(nèi)容啦。趕緊動手試試,讓你的程序也能和 Word 文檔“交流”起來!
總結(jié)
到此這篇關(guān)于用Java輕松讀取Word文檔內(nèi)容的常用方法的文章就介紹到這了,更多相關(guān)Java讀取Word文檔內(nèi)容內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
xxl-job定時任務(wù)配置應(yīng)用及添加到springboot項目中實現(xiàn)動態(tài)API調(diào)用
XXL-JOB是一個分布式任務(wù)調(diào)度平臺,其核心設(shè)計目標是開發(fā)迅速、學(xué)習簡單、輕量級、易擴展,本篇文章主要是對xuxueli的xxl-job做一個簡單的配置,以及將其添加到自己已有的項目中進行api調(diào)用,感興趣的朋友跟隨小編一起看看吧2024-04-04

