最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Java截取PDF內容為圖片的實現代碼

 更新時間:2025年10月27日 09:35:02   作者:何中應  
本文主要介紹了java實現截取PDF指定頁并進行圖片格式轉換功能的技術要點,通過實例代碼,文章詳細地介紹了如何使用java語言來實現PDF指定頁的截取和圖片格式轉換,需要的朋友可以參考下

說明:本文介紹 Java 中,如何去截取 PDF 中的內容,轉為一張圖片

場景

如下,該 PDF 結構分兩部分,一部分個人信息,一部分內容信息,我希望截取其中的內容信息,截取成一張圖片。

在這里插入圖片描述

實現

首先,在生成該 PDF 的模板文件中,需要截取的部分(內容信息)前后,加入截取點,字體設置為白色,這樣截取點內容看不出來

在這里插入圖片描述

編寫代碼,找到 PDF 中截取點文本內容的位置,獲取坐標,并計算

import com.hezy.pojo.TextPositionWithDTO;
import lombok.extern.slf4j.Slf4j;
import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.rendering.PDFRenderer;
import org.apache.pdfbox.text.PDFTextStripper;
import org.apache.pdfbox.text.TextPosition;
import org.springframework.stereotype.Component;

import javax.imageio.ImageIO;
import java.awt.image.BufferedImage;
import java.io.ByteArrayOutputStream;
import java.io.File;
import java.io.IOException;
import java.io.StringWriter;
import java.util.List;

/**
 * PDF裁剪圖片處理器
 */
@Component
@Slf4j
public class PDFCutToImageExtractor {

    /**
     * 開始截取點
     */
    private static final String START_POINT = "cut-start";

    /**
     * 結束截取點
     */
    private static final String END_POINT = "cut-end";

    /**
     * 外邊距
     */
    private static final int MARGIN = 20;

    /**
     * 提取PDF文件中范圍的圖片
     *
     * @param file PDF文件
     * @return 圖片字節(jié)數組
     * @throws IOException
     */
    public byte[] extractImage(File file) throws IOException {
        try (PDDocument document = PDDocument.load(file)) {
            // 1.獲取文本位置
            PDFRenderer renderer = new PDFRenderer(document);
            // 開始和結束位置
            TextPositionWithDTO startPos = findTextPosition(document, START_POINT);
            TextPositionWithDTO endPos = findTextPosition(document, END_POINT);

            // 查詢判斷(截取點是手動放到模板中的,不可能找不到,但還是判斷一下)
            if (startPos == null) {
                return null;
            }
            if (endPos == null) {
                return null;
            }

            // 獲取截取點坐標
            float startY = startPos.getTextPosition().getY();
            float endY = endPos.getTextPosition().getY();
            log.info("截取點坐標:startY={}, endY={}", startY, endY);

            // 2.渲染圖像,計算截取位置
            BufferedImage pageImage = renderer.renderImageWithDPI(startPos.getPageIndex(), 144);
            // 定義縮放,這個是按照上一行代碼中設置的dpi來計算的,144/72=2
            int scale = 2;
            // 左上角坐標 = 起始截取點的x、y坐標
            float startX = startPos.getTextPosition().getX();
            int imgStartX = Math.round(startX * scale) - MARGIN;
            int imgStartY = Math.round(startY * scale);

            // 圖片寬度 = 頁寬 - 起始點x坐標
            int width = pageImage.getWidth() - imgStartX;

            // 圖片高度 = 兩截取點高度差
            int height = Math.round(Math.abs(startY - endY) * scale) - MARGIN;

            // 判斷是否計算有誤
            if (width <= 0 || height <= 0 || imgStartX < 0 || imgStartY < 0) {
                return null;
            }

            // 3.裁剪圖像,將截取后的圖像文件寫入到新的文件流中,返回字節(jié)數組
            log.info("imgStartX: {}, imgStartY: {}, width: {}, height: {}", imgStartX, imgStartY, width, height);
            BufferedImage croppedImage = pageImage.getSubimage(imgStartX, imgStartY, width, height);
            ByteArrayOutputStream bos = new ByteArrayOutputStream();
            try {
                ImageIO.write(croppedImage, "png", bos);
                return bos.toByteArray();
            } catch (IOException e) {
                log.warn("寫入失敗: {}", e.getMessage());
                return null;
            }
        }
    }

    /**
     * 查詢文本位置
     * 作用:該方法的作用是根據傳入的文本關鍵字查詢文本在文檔中所在的位置
     *
     * @param document   PDF文檔
     * @param searchText 要查詢的文本
     * @return 文本位置DTO
     * @throws IOException
     */
    private TextPositionWithDTO findTextPosition(PDDocument document, String searchText) throws IOException {

        /**
         * 內部類:繼承PDFTextStripper,提取PDF文檔中的文本內容
         */
        class MyTextStripper extends PDFTextStripper {

            /**
             * 找到的文本位置
             */
            private TextPosition foundPosition = null;

            public MyTextStripper() throws IOException {
                super();
            }

            @Override
            protected void writeString(String text, List<TextPosition> textPositions) {
                // 文本位置,不為空,說明已經找到了,直接返回
                if (foundPosition != null) {
                    return;
                }

                // 拿到PDF文檔中的文本內容
                StringBuilder stringBuilder = new StringBuilder();
                for (TextPosition pos : textPositions) {
                    String unicode = pos.getUnicode();
                    if (unicode != null) {
                        stringBuilder.append(unicode);
                    }
                }
                String segmentText = stringBuilder.toString();

                // 用傳入的文本與PDF文檔中的文本來匹配,indexOf()方法是精髓
                int index = segmentText.indexOf(searchText);
                // 大于等于0,說明文檔中有匹配到的文本
                if (index >= 0) {
                    int charCount = 0;
                    for (TextPosition pos : textPositions) {
                        String unicode = pos.getUnicode();
                        if (unicode == null) {
                            continue;
                        }
                        if (charCount == index) {
                            foundPosition = pos;
                            return;
                        }
                        charCount++;
                    }
                }
            }

            public TextPosition getResult() {
                return foundPosition;
            }
        }

        // 遍歷每一頁
        int totalPages = document.getNumberOfPages();
        for (int pageIndex = 0; pageIndex < totalPages; pageIndex++) {
            MyTextStripper stripper = new MyTextStripper();
            stripper.setStartPage(pageIndex + 1);
            stripper.setEndPage(pageIndex + 1);

            // 處理當前頁
            stripper.writeText(document, new StringWriter());
            TextPosition result = stripper.getResult();
            if (result != null) {
                return new TextPositionWithDTO(result, pageIndex);
            }
        }
        return null;
    }
}

注意以下兩點:

  • PDF 文本坐標(TextPosition),是以文件左下角為原點的,越靠右x越大,越靠上y越大;
  • pageImage.getSubimage()方法,四個參數定義截取的矩形范圍,前兩個參數定義矩形左上角坐標,后兩個參數定義矩形的寬和高

(源碼說明)

在這里插入圖片描述

TextPositionWithDTO 對象

import lombok.AllArgsConstructor;
import lombok.Data;
import lombok.NoArgsConstructor;
import org.apache.pdfbox.text.TextPosition;

import java.io.Serializable;

/**
 * 文本位置DTO
 */
@Data
@AllArgsConstructor
@NoArgsConstructor
public class TextPositionWithDTO implements Serializable {

    /**
     * 文本位置
     */
    private TextPosition textPosition;

    /**
     * 文本位置所在的頁碼
     */
    private int pageIndex;
}

controller,寫一個接口,先獲取 PDF 文件,再截取其中的圖片

    @PostMapping("/pdf2")
    public byte[] pdf2() throws IOException {
        // 1.獲取PDF
        byte[] pdf = pdfService.pdf();

        // 2.將PDF寫入到本地臨時文件夾中
        File pdfFile = FileUtil.createTempFile("demo", ".pdf", null, true);
        FileUtil.writeBytes(pdf, pdfFile);

        // 3.構建響應
        String fileName = "截取圖片.png";
        String encodedFileName = URLEncoder.encode(fileName, StandardCharsets.UTF_8);
        HttpHeaders headers = new HttpHeaders();
        headers.setContentType(MediaType.APPLICATION_OCTET_STREAM);
        headers.setContentDispositionFormData("attachment", encodedFileName);

        // 4.截取圖片,獲取圖片的字節(jié)數組
        byte[] image = pdfCutToImageExtractor.extractImage(pdfFile);
        
        // 5.刪除臨時存儲的PDF文件
        FileUtil.del(pdfFile);

        // 6.返回
        return ResponseEntity.ok()
                .headers(headers)
                .body(image).getBody();
    }

以上代碼引入的 pom.xml 文件內容如下:

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <parent>
        <groupId>org.springframework.boot</groupId>
        <artifactId>spring-boot-starter-parent</artifactId>
        <version>2.7.12</version>
        <relativePath/>
    </parent>

    <groupId>com.hezy</groupId>
    <artifactId>pdf_demo</artifactId>
    <version>1.0-SNAPSHOT</version>

    <properties>
        <maven.compiler.source>8</maven.compiler.source>
        <maven.compiler.target>8</maven.compiler.target>
        <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding>
    </properties>

    <dependencies>
        <!-- web依賴,用調用接口的方式來測試 -->
        <dependency>
            <groupId>org.springframework.boot</groupId>
            <artifactId>spring-boot-starter-web</artifactId>
        </dependency>

        <!-- 生成pdf依賴 -->
        <dependency>
            <groupId>org.springframework.boot</groupId>
            <artifactId>spring-boot-starter-thymeleaf</artifactId>
        </dependency>
        <dependency>
            <groupId>com.github.jhonnymertz</groupId>
            <artifactId>java-wkhtmltopdf-wrapper</artifactId>
            <version>1.3.1-RELEASE</version>
        </dependency>

        <!-- lombok依賴 -->
        <dependency>
            <groupId>org.projectlombok</groupId>
            <artifactId>lombok</artifactId>
        </dependency>

        <!-- PDF截取依賴 -->
        <dependency>
            <groupId>org.apache.pdfbox</groupId>
            <artifactId>pdfbox</artifactId>
            <version>2.0.27</version>
        </dependency>

        <!-- 工具類 -->
        <dependency>
            <groupId>cn.hutool</groupId>
            <artifactId>hutool-all</artifactId>
            <version>5.8.6</version>
        </dependency>
    </dependencies>

    <!-- 編譯插件,定義編譯語言,后面用于構建PDF文件byte[],返回給前端 -->
    <build>
        <plugins>
            <plugin>
                <groupId>org.apache.maven.plugins</groupId>
                <artifactId>maven-compiler-plugin</artifactId>
                <configuration>
                    <source>17</source>
                    <target>17</target>
                </configuration>
            </plugin>
        </plugins>
    </build>
</project>

關于如何生成 PDF 文件,參看文章:Java將數據寫入到PDF文件

啟動,測試,先來看看生成的 PDF 文件,沒有影響,看不出“內容信息”前后的截取點文本

在這里插入圖片描述

但是,復制空白處,還是可以粘貼出來的

在這里插入圖片描述

看看截取圖片效果,幾乎完美,把“內容信息”部分的文本內容完全截取出來了。

在這里插入圖片描述

總結

以上是我自己思考的一種將 PDF 文件中某部分內容截取成圖片的方案。

這種方法是可以根據填充的內容多少動態(tài)適應,但如果你截取的內容位置是固定的,就更好辦了,直接在下面這個截取方法里寫死范圍

BufferedImage croppedImage = pageImage.getSubimage(imgStartX, imgStartY, width, height);

另外,還需要考慮截取內容跨頁的情況,涉及跨頁,以上代碼可能需要調整。

以上就是Java截取PDF內容為圖片的實現代碼的詳細內容,更多關于Java截取PDF內容為圖片的資料請關注腳本之家其它相關文章!

相關文章

  • IntelliJ IDEA使用maven實現tomcat的熱部署

    IntelliJ IDEA使用maven實現tomcat的熱部署

    這篇文章主要介紹了IntelliJ IDEA使用maven實現tomcat的熱部署,小編覺得挺不錯的,現在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-07-07
  • MyBatis-Plus攔截器實現數據權限控制的示例

    MyBatis-Plus攔截器實現數據權限控制的示例

    本文主要介紹了MyBatis-Plus攔截器實現數據權限控制的示例,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2023-02-02
  • eclipse下搭建hibernate5.0環(huán)境的步驟(圖文)

    eclipse下搭建hibernate5.0環(huán)境的步驟(圖文)

    這篇文章主要介紹了eclipse下搭建hibernate5.0環(huán)境的步驟(圖文),小編覺得挺不錯的,現在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-05-05
  • Java對接樂橙攝像頭詳細步驟(綁定設備/直播/控制)

    Java對接樂橙攝像頭詳細步驟(綁定設備/直播/控制)

    大華樂橙SDK(LechangeSDK)是一套由大華科技推出的智能安防領域專用軟件開發(fā)工具包,下面這篇文章主要介紹了Java對接樂橙攝像頭(綁定設備/直播/控制)的相關資料,文中通過代碼介紹的非常詳細,需要的朋友可以參考下
    2025-12-12
  • 詳解Spring框架注解掃描開啟之配置細節(jié)

    詳解Spring框架注解掃描開啟之配置細節(jié)

    本篇文章主要介紹了詳解Spring框架注解掃描開啟之配置細節(jié),小編覺得挺不錯的,現在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2017-08-08
  • centos下編譯安裝mysql報錯解決方案

    centos下編譯安裝mysql報錯解決方案

    今天在centos6.2下面源碼編譯安裝mysql的時,在編譯mysql的時候報了一個蛋蛋的錯誤,本文提供詳細解決方案
    2012-11-11
  • IDEA意外退出問題及解決

    IDEA意外退出問題及解決

    文章主要講述了解決在使用IDEA拉取項目時,由于堆內存不足導致IDEA自動退出的問題,通過調整IDEA的堆內存大?。╔ms和Xmx),并在執(zhí)行完畢后重新打開IDEA,最終成功解決問題
    2026-04-04
  • IDEA中Mybatis的xml文件報錯問題及解決

    IDEA中Mybatis的xml文件報錯問題及解決

    在IntelliJ IDEA中,MyBatis的XML文件報錯,提示'expected statement, got 'id'',通過找到并修改LanguageInjections的Mybatis相關配置,去掉最前面的sql前綴,禁用默認配置文件,解決了每次重啟IDEA后配置失效的問題
    2025-12-12
  • SpringBoot @ExceptionHandler與@ControllerAdvice異常處理詳解

    SpringBoot @ExceptionHandler與@ControllerAdvice異常處理詳解

    在Spring Boot應用的開發(fā)中,不管是對底層數據庫操作,對業(yè)務層操作,還是對控制層操作,都會不可避免的遇到各種可預知的,不可預知的異常需要處理,如果每個處理過程都單獨處理異常,那么系統(tǒng)的代碼耦合度會很高,工作量大且不好統(tǒng)一,以后維護的工作量也很大
    2022-10-10
  • Spring的Bean注入解析結果BeanDefinition詳解

    Spring的Bean注入解析結果BeanDefinition詳解

    這篇文章主要介紹了Spring的Bean注入解析結果BeanDefinition詳解,BeanDefinition描述了一個bean實例,擁有屬性值、構造參數值和具體實現的其他信息,其是一個bean的元數據,xml中配置的bean元素會被解析成BeanDefinition對象,需要的朋友可以參考下
    2023-12-12

最新評論

普格县| 南乐县| 渭南市| 紫阳县| 泗阳县| 景谷| 江永县| 玛纳斯县| 永福县| 夏河县| 城市| 屯留县| 武义县| 高淳县| 富锦市| 盈江县| 龙门县| 柘荣县| 西乌珠穆沁旗| 清水县| 同德县| 苏州市| 西城区| 渭南市| 武强县| 个旧市| 丘北县| 泾源县| 安庆市| 阿拉善盟| 镇江市| 义乌市| 荔波县| 涿州市| 靖江市| 佳木斯市| 璧山县| 娱乐| 全椒县| 苍南县| 惠水县|