最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Java讀取Excel、docx、pdf和txt等文件萬能方法舉例

 更新時間:2024年09月11日 11:12:03   作者:qq_32885471  
在Java開發(fā)中處理文件是常見需求,本文以實際代碼示例詳述如何使用ApachePOI庫及其他工具讀取和寫入Excel、Word、PDF等文件,介紹了ApachePOI、ApachePDFBox和EasyExcel等庫的使用方法,幫助開發(fā)者有效讀取不同格式文件,需要的朋友可以參考下

前言

在 Java 開發(fā)中,我們經常需要讀取不同類型的文件,包括 Excel 表格文件、"doc" 和 "docx" 文檔文件、PDF 文件以及純文本文件。

其中最常用的是 Apache POI 庫。Apache POI 是一個流行的 Java 庫,提供了許多 API 來讀取和寫入 Microsoft Office 文檔,包括 Excel、Word 和 PowerPoint 等。

本文將介紹如何使用 Java 讀取這些不同類型的文件。(本文的方法可供參考,還有其它方法讀者自行查閱。)

1.舉個栗子

以下是本人在開發(fā)過程中,讀取"doc"、"docx"、"pdf" 和 "txt" 文件的代碼例子,后面將詳細解釋。

txt文件讀取不多說,用流讀取。

import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.text.PDFTextStripper;
import org.apache.poi.hwpf.extractor.WordExtractor;
import org.apache.poi.xwpf.extractor.XWPFWordExtractor;
import org.apache.poi.xwpf.usermodel.XWPFDocument;

//fileExtension文件后綴名
private String readFileContent(MultipartFile file, String fileExtension) throws IOException {  
    byte[] fileBytes = file.getBytes();  
    if (fileBytes.length == 0){  
        throw new BusinessException(ResultCodeEnum.FILE_CONTENT_IS_EMPTY);  
    }  
    switch (fileExtension) {  
        case "txt":  
            return new String(fileBytes, StandardCharsets.UTF_8);  
        case "pdf":  
            try (PDDocument doc = PDDocument.load(file.getInputStream())) {  
            PDFTextStripper textStripper = new PDFTextStripper();  
            return textStripper.getText(doc);  
            }  
        case "docx":  
            try (InputStream stream = file.getInputStream()) {  
            XWPFDocument xdoc = new XWPFDocument(stream);  
            XWPFWordExtractor extractor = new XWPFWordExtractor(xdoc);  
            return extractor.getText();  
            }  
        case "doc":  
            try (InputStream stream = file.getInputStream()) {  
            WordExtractor extractor = new WordExtractor(stream);  
            return extractor.getText();  
            }  
        default:  
            log.error("不支持的文件格式");  
            return null;  
    }
}

2.導入依賴包

<dependencies>
  <!-- Apache POI 讀取和寫入 Microsoft Office 文檔 -->
  <dependency>
    <groupId>org.apache.poi</groupId>
    <artifactId>poi</artifactId>
    <version>5.0.0</version>
  </dependency>
  <dependency>
    <groupId>org.apache.poi</groupId>
    <artifactId>poi-ooxml</artifactId>
    <version>5.0.0</version>
  </dependency>

  <!-- Apache PDFBox 處理 PDF 文件 -->
  <dependency>
    <groupId>org.apache.pdfbox</groupId>
    <artifactId>pdfbox</artifactId>
    <version>2.0.24</version>
  </dependency>

  <!-- Apache Tika 自動檢測和提取元數(shù)據和文本內容 -->
  <dependency>
    <groupId>org.apache.tika</groupId>
    <artifactId>tika-core</artifactId>
    <version>2.1.0</version>
  </dependency>

  <!-- iText 處理 PDF 文件 -->
  <dependency>
    <groupId>com.itextpdf</groupId>
    <artifactId>itextpdf</artifactId>
    <version>5.5.13</version>
  </dependency>
</dependencies>

1.讀取pdf

讀取 PDF 文件可以使用 Apache PDFBox 庫。以下是一個示例代碼,用于讀取 PDF 文件的文本內容:

import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.text.PDFTextStripper;

import java.io.File;
import java.io.IOException;

public class PdfReaderExample {
    public static void main(String[] args) {
        try {
            // 1. 加載 PDF 文檔
            File file = new File("path_to_your_pdf_file.pdf");
            PDDocument document = PDDocument.load(file);

            // 2. 創(chuàng)建 PDFTextStripper 對象,并提取文本內容
            PDFTextStripper textStripper = new PDFTextStripper();
            String content = textStripper.getText(document);

            // 3. 輸出文本內容
            System.out.println(content);

            // 4. 關閉 PDF 文檔
            document.close();
        } catch (IOException e) {
            e.printStackTrace();
        }
    }
}

請確保將 path_to_your_pdf_file.pdf 替換為實際的 PDF 文件路徑。通過調用 PDDocument.load() 方法加載 PDF 文件,然后創(chuàng)建一個 PDFTextStripper 對象,并使用 getText() 方法提取文本內容。最后,使用 document.close() 方法關閉 PDF 文檔。

PDDocument.load() 方法接受多種類型的參數(shù)來加載 PDF 文檔。以下是常用的參數(shù)類型:

  • File 對象: 可以傳遞一個 java.io.File 對象,指向要加載的 PDF 文件。例如:PDDocument.load(new File("path_to_your_pdf_file.pdf"))。

  • 文件路徑字符串: 可以直接傳遞一個字符串,表示要加載的 PDF 文件的路徑。例如:PDDocument.load("path_to_your_pdf_file.pdf")。

  • InputStream 對象: 可以傳遞一個 java.io.InputStream 對象,從中讀取 PDF 內容。例如:PDDocument.load(inputStream)。

  • RandomAccessRead 對象: 可以傳遞一個 org.apache.pdfbox.io.RandomAccessRead 對象,用于隨機訪問和讀取 PDF 內容。例如:PDDocument.load(randomAccessRead)。

使用不同的參數(shù)類型,可以根據你的需求來加載 PDF 文檔。請注意,無論使用哪種方式,都需要正確處理可能拋出的 IOException 異常,并在使用完 PDDocument 對象后調用 close() 方法關閉文檔以釋放資源。

2.讀取docx

讀取 DOCX 文件,可以使用 Apache POI 庫。

import org.apache.poi.xwpf.usermodel.XWPFDocument;
import org.apache.poi.xwpf.usermodel.XWPFParagraph;

import java.io.File;
import java.io.FileInputStream;
import java.io.IOException;
import java.io.InputStream;

public class DocxReaderExample {
    public static void main(String[] args) {
        try {
            // 1. 加載 DOCX 文檔
            File file = new File("path_to_your_docx_file.docx");
            InputStream fis = new FileInputStream(file);
            XWPFDocument document = new XWPFDocument(fis);

            // 2. 提取文本內容
            StringBuilder content = new StringBuilder();
            for (XWPFParagraph paragraph : document.getParagraphs()) {
                content.append(paragraph.getText());
                content.append("\n");
            }

            // 3. 輸出文本內容
            System.out.println(content.toString());

            // 4. 關閉 DOCX 文檔
            document.close();
            fis.close();
        } catch (IOException e) {
            e.printStackTrace();
        }
    }
}

通過創(chuàng)建一個 FileInputStream 對象,并將其傳遞給 XWPFDocument 構造函數(shù),來加載 DOCX 文件。然后,通過遍歷文檔中的段落,使用 getText() 方法提取文本內容,并將其存儲在一個 StringBuilder 中。最后,輸出文本內容。

提取文本內容,提供另外一種方法。

XWPFDocument document = new XWPFDocument(fis); 
// 2. 提取文本內容 
XWPFWordExtractor extractor = new XWPFWordExtractor(document); 
String text = extractor.getText();

XWPFWordExtractor 是 Apache POI 庫中的一個類,用于從 XWPFDocument 對象中提取文本。

然后,調用 getText() 方法,通過 extractor 對象提取文本內容。該方法會返回一個包含整個文檔純文本的字符串。

3.讀取doc

讀取 DOC(.doc)文件,可以使用 Apache POI 庫中的 HWPF 模塊

import org.apache.poi.hwpf.HWPFDocument;
import org.apache.poi.hwpf.extractor.WordExtractor;

import java.io.File;
import java.io.FileInputStream;
import java.io.IOException;

public class DocTextExtractor {
    public static String extractTextFromDoc(String filePath) {
        try {
            // 1. 加載 DOC 文檔
            File file = new File(filePath);
            FileInputStream fis = new FileInputStream(file);
            HWPFDocument document = new HWPFDocument(fis);

            // 2. 提取文本內容
            WordExtractor extractor = new WordExtractor(document);
            String text = extractor.getText();

            // 3. 關閉 DOC 文檔和提取器
            extractor.close();
            document.close();
            fis.close();

            // 4. 返回提取的文本內容
            return text;
        } catch (IOException e) {
            e.printStackTrace();
        }
        return null;
    }

    public static void main(String[] args) {
        String filePath = "path_to_your_doc_file.doc";
        String extractedText = extractTextFromDoc(filePath);
        System.out.println(extractedText);
    }
}

4.讀取Excel

1.使用 Apache POI 庫讀取 Excel 文件

import java.io.File;
import java.io.FileInputStream;
import java.io.IOException;
import org.apache.poi.ss.usermodel.Cell;
import org.apache.poi.ss.usermodel.Row;
import org.apache.poi.ss.usermodel.Sheet;
import org.apache.poi.xssf.usermodel.XSSFWorkbook;

public class ExcelReader {
    
    public static void main(String[] args) throws IOException {
        File file = new File("path/to/excel/file");
        FileInputStream inputStream = new FileInputStream(file);
        XSSFWorkbook workbook = new XSSFWorkbook(inputStream);
        Sheet sheet = workbook.getSheetAt(0);
        for (Row row : sheet) {
            for (Cell cell : row) {
                System.out.print(cell.toString() + "\t");
            }
            System.out.println();
        }
        workbook.close();
    }
}

首先創(chuàng)建了一個 File 對象來表示要讀取的 Excel 文件,然后創(chuàng)建了一個 FileInputStream 對象來讀取文件。接著,我們使用 XSSFWorkbook 類創(chuàng)建了一個 workbook 對象來表示整個 Excel 文檔,并獲取了第一個工作表(即索引為 0 的工作表)。

在循環(huán)中,我們首先遍歷每一行 (Row),然后再遍歷每一列 (Cell)。我們可以使用 cell.toString() 方法獲取單元格的值,并打印出來。最后,我們調用 workbook.close() 方法關閉工作簿,釋放資源。

2.使用easyExcel

EasyExcel 是一款開源的 Java Excel 操作工具,它提供了簡單易用的 API 來讀取、寫入和操作 Excel 文件。

<dependency>
    <groupId>com.alibaba</groupId>
    <artifactId>easyexcel</artifactId>
    <version>2.4.3</version>
</dependency>

讀取excel文件

import com.alibaba.excel.EasyExcel;
import com.alibaba.excel.read.builder.ExcelReaderBuilder;
import com.alibaba.excel.read.listener.ReadListener;

public class ExcelReader {
    public static void main(String[] args) {
        String filePath = "path_to_your_excel_file.xlsx";

        // 創(chuàng)建 Excel 讀取器
        ExcelReaderBuilder readerBuilder = EasyExcel.read(filePath);

        // 注冊讀取監(jiān)聽器
        ReadListener<Object> listener = new YourReadListener();
        readerBuilder.registerReadListener(listener);

        // 執(zhí)行讀取操作
        readerBuilder.sheet().doRead();
    }
}

通過 EasyExcel.read(filePath) 創(chuàng)建了一個 Excel 讀取器,然后通過 registerReadListener() 方法注冊了一個讀取監(jiān)聽器,你需要自己實現(xiàn)一個 ReadListener 的子類,并在其中重寫相應的方法來處理讀取到的數(shù)據。最后,通過 sheet().doRead() 方法執(zhí)行讀取操作。

總結

到此這篇關于Java讀取Excel、docx、pdf和txt等文件萬能方法的文章就介紹到這了,更多相關Java讀取Excel、docx、pdf和txt文件內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • Spring?循環(huán)依賴之AOP實現(xiàn)詳情

    Spring?循環(huán)依賴之AOP實現(xiàn)詳情

    這篇文章主要介紹了Spring?循環(huán)依賴之AOP實現(xiàn)詳情,文章圍繞主題展開詳細的內容介紹,具有一定的參考價值,需要的盆友可以參考一下
    2022-07-07
  • SpringBoot 中 CommandLineRunner的作用示例詳解

    SpringBoot 中 CommandLineRunner的作用示例詳解

    SpringBoot提供的一種簡單的實現(xiàn)方案就是添加一個model并實現(xiàn)CommandLineRunner接口,實現(xiàn)功能的代碼放在實現(xiàn)的run方法中,本文給大家介紹SpringBoot中CommandLineRunner的作用,感興趣的朋友一起看看吧
    2025-06-06
  • SpringBoot打包前重新拉取maven依賴的方法實現(xiàn)

    SpringBoot打包前重新拉取maven依賴的方法實現(xiàn)

    在使用 Maven 構建 Spring Boot 項目時,如果希望在每次打包時都強制拉取依賴,可以通過以下方法實現(xiàn),本文給大家介紹了四種實現(xiàn)方法,并通過代碼講解的非常詳細,需要的朋友可以參考下
    2024-12-12
  • IDEA啟動服務提示端口被占用,Web?server?failed?to?start.Port?was?already?in?use.

    IDEA啟動服務提示端口被占用,Web?server?failed?to?start.Port?was?al

    這篇文章主要介紹了IDEA啟動服務提示端口被占用,Web?server?failed?to?start.Port?was?already?in?use.,本文給大家分享解決方案,分為linux系統(tǒng)和windows系統(tǒng)解決方案,需要的朋友可以參考下
    2023-07-07
  • 詳解springSecurity之java配置篇

    詳解springSecurity之java配置篇

    這篇文章主要介紹了詳解springSecurity之java配置篇,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-07-07
  • SpringBoot之統(tǒng)一數(shù)據返回格式的實現(xiàn)示例

    SpringBoot之統(tǒng)一數(shù)據返回格式的實現(xiàn)示例

    本文主要介紹了SpringBoot之統(tǒng)一數(shù)據返回格式的實現(xiàn)示例,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2025-12-12
  • Spring?MVC?前端控制器?(DispatcherServlet)處理流程解析

    Spring?MVC?前端控制器?(DispatcherServlet)處理流程解析

    DispatcherServlet是前置控制器,配置在web.xml文件中的,這篇文章主要介紹了Spring?MVC?前端控制器?(DispatcherServlet)處理流程,需要的朋友可以參考下
    2022-05-05
  • Java多線程之scheduledThreadPool的方法解析

    Java多線程之scheduledThreadPool的方法解析

    這篇文章主要介紹了Java多線程之scheduledThreadPool的方法解析,queue是DelayedWorkQueue,但通過后面的分析可以知道,最大線程數(shù)是不起作用的,最多會起核心線程數(shù)的數(shù)量,需要的朋友可以參考下
    2023-12-12
  • IDEA導入下載的項目后左側沒有樹狀層級目錄的解決方案

    IDEA導入下載的項目后左側沒有樹狀層級目錄的解決方案

    這篇文章主要介紹了IDEA導入下載的項目后左側沒有樹狀層級目錄的解決方案,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2025-08-08
  • Java中Pattern用法實例(正則表達式)

    Java中Pattern用法實例(正則表達式)

    Pattern在java.util.regex包中,是正則表達式的編譯表示形式,此類的實例是不可變的,可供多個并發(fā)線程安全使用,下面這篇文章主要給大家介紹了關于Java正則表達式Pattern用法的相關資料,需要的朋友可以參考下
    2022-07-07

最新評論

墨竹工卡县| 珲春市| 天台县| 南召县| 清水河县| 沾益县| 滁州市| 广饶县| 温泉县| 景洪市| 巴彦淖尔市| 绥芬河市| 嘉义市| 竹北市| 越西县| 红安县| 汾西县| 湟源县| 沭阳县| 阿拉尔市| 漳平市| 大石桥市| 汪清县| 灵山县| 突泉县| 梅州市| 宝清县| 民和| 江安县| 迭部县| 琼海市| 大余县| 曲周县| 岳西县| 峡江县| 大荔县| 通州市| 陆良县| 察哈| 托克托县| 宝坻区|