最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Java使用PDFBox提取PDF文本并統(tǒng)計關鍵詞出現(xiàn)的次數(shù)

 更新時間:2025年05月16日 11:00:57   作者:碼農(nóng)研究僧  
這篇文章主要介紹了Apache PDFBox庫的基本知識,包括如何使用PDDocument加載PDF文件、PDFTextStripper提取文本以及如何進行詞頻統(tǒng)計,還提供了在線URL的處理方法,需要的朋友可以參考下

1. 基本知識

Apache PDFBox 是一個開源的 Java PDF 操作庫,支持:

  • 讀取 PDF 文件內(nèi)容(包括文字、圖片、元數(shù)據(jù))

  • 創(chuàng)建和修改 PDF 文檔

  • 提取文本內(nèi)容用于搜索、分析等操作

Maven相關的依賴:

<dependency>
    <groupId>org.apache.pdfbox</groupId>
    <artifactId>pdfbox</artifactId>
    <version>2.0.29</version>
</dependency>

需下載 在進行統(tǒng)計:

import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.text.PDFTextStripper;

import java.io.File;
import java.io.IOException;

public class PDFWordCounter {

    public static void main(String[] args) {
        String pdfPath = "sample.pdf";  // 替換為你的 PDF 文件路徑
        String keyword = "Java";        // 要統(tǒng)計的詞語

        try {
            // 加載 PDF 文檔
            PDDocument document = PDDocument.load(new File(pdfPath));

            // 使用 PDFTextStripper 提取文本
            PDFTextStripper stripper = new PDFTextStripper();
            String text = stripper.getText(document);
            document.close(); // 記得關閉文檔資源

            // 轉小寫處理,方便忽略大小寫
            String lowerText = text.toLowerCase();
            String lowerKeyword = keyword.toLowerCase();

            // 調(diào)用詞頻統(tǒng)計函數(shù)
            int count = countOccurrences(lowerText, lowerKeyword);

            System.out.println("詞語 \"" + keyword + "\" 出現(xiàn)次數(shù): " + count);
        } catch (IOException e) {
            e.printStackTrace();
        }
    }

    // 使用 indexOf 遍歷匹配詞語出現(xiàn)次數(shù)
    private static int countOccurrences(String text, String word) {
        int count = 0;
        int index = 0;
        while ((index = text.indexOf(word, index)) != -1) {
            count++;
            index += word.length();
        }
        return count;
    }
}

上述的Demo詳細分析下核心知識:

  1. PDDocument.load(File)
    用于加載 PDF 文件到內(nèi)存中
    PDFBox 使用 PDDocument 表示整個 PDF 對象,使用完后必須調(diào)用 close() 釋放資源

  2. PDFTextStripper
    PDFBox 中用于提取文字的核心類,會盡可能“以閱讀順序”提取文本,適用于純文字 PDF 文件。對于圖像型掃描件則無效(需 OCR)

  3. 大小寫不敏感統(tǒng)計
    實際應用中搜索關鍵詞通常需要忽略大小寫,因此我們先統(tǒng)一將文本和關鍵詞轉換為小寫

  4. indexOf 實現(xiàn)詞頻統(tǒng)計
    這是最基礎也最直觀的統(tǒng)計方法,效率較高,但不夠精確
    如果需要更精確(只統(tǒng)計完整單詞),可以使用正則:

Pattern pattern = Pattern.compile("\\b" + Pattern.quote(word) + "\\b", Pattern.CASE_INSENSITIVE);
Matcher matcher = pattern.matcher(text);
int count = 0;
while (matcher.find()) {
    count++;
}

2. 在線URL

2.1 英文

此處的Demo需要注意一個點:

注意點說明
PDF 文件是否公開訪問不能訪問受密碼或登錄保護的 PDF
文件大小不建議下載和分析過大文件,可能導致內(nèi)存問題
中文 PDF若是掃描圖片形式的中文 PDF,則 PDFBox 無法直接提取文本(需 OCR)
編碼問題若中文顯示為亂碼,可能是 PDF 沒有內(nèi)嵌字體

思路:

  • 通過 URL.openStream() 獲取在線 PDF 的輸入流

  • 使用 PDFBox 的 PDDocument.load(InputStream) 讀取 PDF

  • 用 PDFTextStripper 提取文本

  • 用字符串方法或正則統(tǒng)計關鍵詞頻率

import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.text.PDFTextStripper;

import java.io.InputStream;
import java.net.URL;
import java.util.regex.Matcher;
import java.util.regex.Pattern;

public class OnlinePDFKeywordCounter {

    public static void main(String[] args) {
        String pdfUrl = "https://www.example.com/sample.pdf"; // 你的在線 PDF 鏈接
        String keyword = "Java";  // 需要統(tǒng)計的關鍵詞

        try (InputStream inputStream = new URL(pdfUrl).openStream();
             PDDocument document = PDDocument.load(inputStream)) {

            PDFTextStripper stripper = new PDFTextStripper();
            String text = stripper.getText(document);

            // 使用正則匹配單詞邊界(忽略大小寫)
            Pattern pattern = Pattern.compile("\\b" + Pattern.quote(keyword) + "\\b", Pattern.CASE_INSENSITIVE);
            Matcher matcher = pattern.matcher(text);

            int count = 0;
            while (matcher.find()) {
                count++;
            }

            System.out.println("詞語 \"" + keyword + "\" 出現(xiàn)在在線 PDF 中的次數(shù)為: " + count);

        } catch (Exception e) {
            System.err.println("處理 PDF 時出錯: " + e.getMessage());
            e.printStackTrace();
        }
    }
}

2.2 混合

方法適用場景是否支持中文
indexOf中英文都適用?
Pattern + \\b僅限英文單詞匹配? 中文不支持

正則表達式 \\b...\\b(表示“單詞邊界”)并不適用于中文

統(tǒng)計在想的URL PDF的詞頻:

import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.text.PDFTextStripper;

import java.io.InputStream;
import java.net.URL;

public class OnlinePDFKeywordCounter {

    public static void main(String[] args) {
        String pdfUrl = "https://www.xxxx.pdf";
        String keyword = "管理層";  // 要統(tǒng)計的中文關鍵詞

        try (InputStream inputStream = new URL(pdfUrl).openStream();
             PDDocument document = PDDocument.load(inputStream)) {

            PDFTextStripper stripper = new PDFTextStripper();
            String text = stripper.getText(document);

            // 直接用 indexOf 不區(qū)分大小寫(對于中文沒必要轉小寫)
            int count = countOccurrences(text, keyword);
            System.out.println("詞語 \"" + keyword + "\" 出現(xiàn)次數(shù)為: " + count);

        } catch (Exception e) {
            System.err.println("處理 PDF 時出錯: " + e.getMessage());
            e.printStackTrace();
        }
    }

    // 簡單統(tǒng)計子串出現(xiàn)次數(shù)(適用于中文)
    private static int countOccurrences(String text, String keyword) {
        int count = 0;
        int index = 0;
        while ((index = text.indexOf(keyword, index)) != -1) {
            count++;
            index += keyword.length();
        }
        return count;
    }
}

截圖如下:

以上就是Java使用PDFBox提取PDF文本并統(tǒng)計關鍵詞出現(xiàn)的次數(shù)的詳細內(nèi)容,更多關于Java PDFBox提取PDF文本并統(tǒng)計的資料請關注腳本之家其它相關文章!

相關文章

  • 使用IntelliJ IDEA 2017.2.5 x64中的Spring Initializr插件快速創(chuàng)建Spring Boot/Cloud工程(圖解)

    使用IntelliJ IDEA 2017.2.5 x64中的Spring Initializr插件快速創(chuàng)建Spring

    這篇文章主要介紹了使用IntelliJ IDEA 2017.2.5 x64中的Spring Initializr插件快速創(chuàng)建Spring Boot/Cloud工程(圖解),需要的朋友可以參考下
    2018-01-01
  • SpringBoot整合flyway實現(xiàn)自動創(chuàng)建表的方法

    SpringBoot整合flyway實現(xiàn)自動創(chuàng)建表的方法

    這篇文章主要介紹了SpringBoot整合flyway實現(xiàn)自動創(chuàng)建表的方法,本文通過實例代碼給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-03-03
  • Java使用RedisTemplate如何根據(jù)前綴獲取key列表

    Java使用RedisTemplate如何根據(jù)前綴獲取key列表

    這篇文章主要介紹了Java使用RedisTemplate如何根據(jù)前綴獲取key列表,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-06-06
  • java如何用正則表達式匹配與提取字符串

    java如何用正則表達式匹配與提取字符串

    一位以前的同事在群里面突然發(fā)了個需求,要通過正則表達式來取值,下面這篇文章主要給大家介紹了關于java如何用正則表達式匹配與提取字符串的相關資料,需要的朋友可以參考下
    2022-06-06
  • Java實現(xiàn)設計模式之責任鏈模式

    Java實現(xiàn)設計模式之責任鏈模式

    責任鏈模式是一種行為設計模式,允許你將請求沿著處理鏈發(fā)送,然后處理者都可對其進行處理,完成后可以再將其傳遞給下一個處理者。下面將會舉例說明什么是責任鏈模式,責任鏈模式該如何使用
    2022-08-08
  • MyBatis中如何獲取Oracle序列

    MyBatis中如何獲取Oracle序列

    文章介紹了在使用MyBatis時,如何通過獲取序列的下一個值來完成某些功能操作,并在之后進行數(shù)據(jù)的添加操作,文中特別強調(diào)了在獲取序列值后不能單獨執(zhí)行插入操作,否則會報錯
    2024-12-12
  • Java中的getBytes()方法使用詳解

    Java中的getBytes()方法使用詳解

    這篇文章主要介紹了Java中getBytes()方法使用的相關資料,getBytes()方法有多個重載形式,可以根據(jù)需要指定字符集來進行轉換,文中通過代碼介紹的非常詳細,需要的朋友可以參考下
    2025-05-05
  • 利用Java實體bean對象批量數(shù)據(jù)傳輸處理方案小結

    利用Java實體bean對象批量數(shù)據(jù)傳輸處理方案小結

    javabean是對面向對象思想的一種具體實施的表現(xiàn),本文重點給大家介紹利用Java實體bean對象批量數(shù)據(jù)傳輸處理方案小結,本文通過兩種方案給大家介紹的非常詳細,感興趣的朋友跟隨小編一起看看吧
    2021-05-05
  • Java并發(fā)中的ThreadLocal使用詳解

    Java并發(fā)中的ThreadLocal使用詳解

    ThreadLocal 是 Java 中實現(xiàn)線程局部變量的重要工具,它能讓每個線程擁有自己獨立的變量副本,從而在多線程環(huán)境下避免共享數(shù)據(jù)的競爭問題,下面給大家介紹java并發(fā)中的ThredLocal使用詳解,感興趣的朋友跟隨小編一起看看吧
    2026-03-03
  • 基于binarywang封裝的微信工具包生成二維碼

    基于binarywang封裝的微信工具包生成二維碼

    這篇文章主要介紹了基于binarywang封裝的微信工具包生成二維碼,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-11-11

最新評論

思茅市| 京山县| 襄城县| 山西省| 星座| 宝山区| 永州市| 宁津县| 宝兴县| 赫章县| 白沙| 沂南县| 沧源| 和硕县| 许昌市| 勐海县| 交口县| 广河县| 阜宁县| 天长市| 微山县| 襄汾县| 郁南县| 吕梁市| 桃江县| 监利县| 光泽县| 横峰县| 介休市| 陈巴尔虎旗| 揭阳市| 札达县| 贺州市| 白河县| 石棉县| 陇西县| 山西省| 深泽县| 克什克腾旗| 乌恰县| 琼结县|