使用 GroupDocs.Parser 的 Java 文件處理
快速解答
- GroupDocs.Parser 的功能是什麼? 它可以從超過 100 種文件類型中提取原始和格式化的文字(在 Java 中)。
- 本教學的主要關鍵字是什麼? java document processing.
- 我需要授權嗎? 提供免費試用;正式環境需要付費授權。
- 我可以提取 HTML 格式的文字嗎? 可以,使用
FormattedTextOptions搭配FormattedTextMode.Html。 - Maven 是唯一的加入函式庫方式嗎? 不是,您也可以直接下載 JAR。
什麼是 java document processing?
Java document processing 指的是一系列技術與函式庫,使 Java 應用程式能讀取、分析與操作 PDF、Word 文件、試算表等檔案的內容。使用 GroupDocs.Parser,您可以快速 extract text java,而不必處理底層檔案格式。
為什麼在 java document processing 中使用 GroupDocs.Parser?
- 廣泛的格式支援 – 支援 PDF、DOCX、XLSX、PPTX 等多種格式。
- 格式化輸出 – 您可以取得 HTML、RTF 或純文字。
- 簡易 API – 幾行程式碼即可取得所需內容。
- 可擴展效能 – 適用於批次處理與高吞吐量服務。
先決條件
- Java Development Kit (JDK) – 8 版或以上。
- IDE – IntelliJ IDEA、Eclipse,或您偏好的任何編輯器。
- Maven(可選) – 用於相依管理。
- 基本的 Java 知識 – 您應該熟悉 try‑with‑resources 與例外處理。
設定 GroupDocs.Parser(Java 版)
Maven 設定
在您的 pom.xml 中加入以下設定,即可從官方倉庫取得函式庫:
<repositories>
<repository>
<id>repository.groupdocs.com</id>
<name>GroupDocs Repository</name>
<url>https://releases.groupdocs.com/parser/java/</url>
</repository>
</repositories>
<dependencies>
<dependency>
<groupId>com.groupdocs</groupId>
<artifactId>groupdocs-parser</artifactId>
<version>25.5</version>
</dependency>
</dependencies>
直接下載
如果您偏好手動安裝,請從官方發佈頁面取得最新的 JAR:GroupDocs.Parser for Java releases。
授權取得步驟
- 免費試用 – 立即開始探索。
- 臨時授權 – 從 GroupDocs 的網站 申請,以延長測試時間。
- 正式授權 – 購買以供正式使用。
基本初始化
以下是建立 Parser 實例的最小程式碼:
import com.groupdocs.parser.Parser;
try (Parser parser = new Parser("YOUR_DOCUMENT_DIRECTORY")) {
// Your parsing logic here
}
實作指南
使用 GroupDocs.Parser 解析文件
本節將帶您了解 extract formatted text,以及如何處理不支援格式的情況。
建立格式化文字選項
import com.groupdocs.parser.Parser;
import com.groupdocs.parser.data.TextReader;
import com.groupdocs.parser.options.FormattedTextOptions;
import com.groupdocs.parser.options.FormattedTextMode;
try (Parser parser = new Parser("YOUR_DOCUMENT_DIRECTORY")) {
// Create formatted text options for HTML format
FormattedTextOptions options = new FormattedTextOptions(FormattedTextMode.Html);
// Extract formatted text into a reader object
try (TextReader reader = parser.getFormattedText(options)) {
// Check if formatted text extraction is supported and read to end
String extractedText = reader == null ? "Formatted text extraction isn't supported" : reader.readToEnd();
// The extracted text can be used further as needed
}
}
說明
FormattedTextOptions告訴解析器您想要的輸出格式(此例為 HTML)。parser.getFormattedText(options)會回傳TextReader。若文件類型不支援格式化提取,該方法會回傳null。- 請務必使用 try‑with‑resources 關閉
Parser與TextReader,以釋放原生資源。
處理不支援的格式化文字提取
try (Parser parser = new Parser("YOUR_DOCUMENT_DIRECTORY")) {
// Attempt to extract formatted text with HTML format options
try (TextReader reader = parser.getFormattedText(new FormattedTextOptions(FormattedTextMode.Html))) {
if (reader == null) {
String message = "Formatted text extraction isn't supported for this document type.";
// The message can be logged or handled as required
}
}
}
說明
null檢查對於健全的 parse documents java 實作至關重要。- 當格式化輸出不可用時,您可以記錄警告、顯示 UI 訊息,或回退至純文字提取。
常見陷阱與故障排除
- 檔案路徑錯誤 – 確認路徑指向存在且可讀取的檔案。
- 不支援的格式 – 並非所有格式都支援 HTML 輸出;請回退至
parser.getPlainText()。 - 資源洩漏 – 必須使用 try‑with‑resources;否則可能觸及原生記憶體限制。
實務應用
以下是幾個 java document processing 發揮效益的實務情境:
- 自動化資料提取 – 在不需手動複製貼上的情況下擷取發票號碼、日期或合約條款。
- 文件轉換服務 – 將 PDF 或 DOCX 轉換為可搜尋的 HTML,供網站入口使用。
- CMS 強化 – 自動為上傳的文件產生預覽與中繼資料。
- 協作平台 – 提取關鍵資訊以支援搜尋與推薦引擎。
效能考量
- 記憶體管理 – 及時關閉
Parser物件;Java 的 GC 會回收原生緩衝區。 - 批次處理 – 在解析多個小檔案時重複使用同一個
Parser實例,以降低開銷。 - 平行執行 – 在不同執行緒中執行獨立的解析任務,但每個
Parser必須限制於單一執行緒。
常見問與答
Q: GroupDocs.Parser Java 的用途是什麼?
A: 它可從各種文件格式中提取文字與中繼資料,適用於 extract text java 的情境。
Q: 我可以使用 GroupDocs.Parser 解析 PDF 嗎?
A: 可以,PDF 完全支援,包括純文字與格式化提取。
Q: 我該如何處理不支援的文件類型?
A: 檢查 getFormattedText 回傳的 TextReader 是否為 null,若是則回退至純文字方法或記錄警告。
Q: 使用 GroupDocs.Parser 需要付費嗎?
A: 提供免費試用;正式環境需要商業授權。
Q: 我在哪裡可以找到更多關於 GroupDocs.Parser Java 的資源?
A: 請參閱官方文件,並探索社群論壇以取得支援。
結論
透過精通 GroupDocs.Parser,您現在擁有一套強大的工具,可用於 java document processing,能提取原始與格式化文字、處理不支援的情況,並可擴展至大量工作負載。將上述程式碼片段整合到您的服務中,即可簡化資料提取、提升可搜尋性,減少人工操作。
Last Updated: 2026-04-07
Tested With: GroupDocs.Parser 25.5 (or later)
Author: GroupDocs