Triển khai GroupDocs.Search Java cho Tìm kiếm Tài liệu

Trong môi trường dựa trên dữ liệu ngày nay, implement groupdocs search java là thiết yếu cho bất kỳ ứng dụng nào cần tìm kiếm toàn văn nhanh chóng, đáng tin cậy trên PDF, tệp Word, bảng tính và hơn thế nữa. Cho dù bạn đang xây dựng kho lưu trữ hợp đồng pháp lý, cổng nghiên cứu học thuật, hay cơ sở tri thức hỗ trợ khách hàng, hướng dẫn này sẽ dẫn bạn qua việc cài đặt SDK, tạo chỉ mục, chạy truy vấn mờ, và tạo HTML với các thuật ngữ tìm kiếm được đánh dấu — tất cả bằng Java.

Câu trả lời nhanh

  • Thư viện nào giúp implement groupdocs search java? GroupDocs.Search for Java.
  • Có thể đánh dấu các thuật ngữ tìm kiếm java trong kết quả không? Yes—generated HTML can automatically wrap matches with <mark> tags.
  • Tôi có cần giấy phép cho môi trường sản xuất không? A free trial is available; a full license is required for commercial use.
  • IDE nào hoạt động tốt nhất? Any Java IDE—IntelliJ IDEA, Eclipse, or VS Code.
  • Maven có được hỗ trợ không? Absolutely—add the repository and dependency to your pom.xml.

GroupDocs.Search cho Java là gì?

GroupDocs.Search là một SDK Java cho phép lập chỉ mục và tìm kiếm văn bản trên hơn 50+ định dạng tài liệu (PDF, DOCX, XLSX, PPTX, TXT, v.v.) mà không cần tải toàn bộ tệp vào bộ nhớ. Nó cung cấp khớp mờ, các toán tử Boolean, truy vấn cụm từ, và tính năng đánh dấu kết quả tích hợp, biến nó thành một giải pháp trọn gói cho các kho lưu trữ tài liệu có thể tìm kiếm.

Tại sao nên sử dụng Search Documents Java với GroupDocs.Search?

Nó cung cấp tốc độ với các tìm kiếm đã lập chỉ mục trả về kết quả trong vòng dưới 10 ms cho 10 k tài liệu, tính linh hoạt thông qua tìm kiếm mờ, logic Boolean, truy vấn cụm từ và mở rộng đồng nghĩa, đánh dấu bằng cách tạo các bản xem trước HTML tự động đánh dấu các kết quả trùng khớp, và khả năng mở rộng bằng cách hoạt động trên máy chủ nội bộ, trên đám mây, hoặc môi trường hybrid trong khi xử lý các tệp hàng trăm trang mà không tiêu tốn quá nhiều bộ nhớ.

Yêu cầu trước

  • Java Development Kit (JDK) 8 hoặc cao hơn.
  • Maven (hoặc quản lý JAR thủ công).
  • Một IDE như IntelliJ IDEA, Eclipse, hoặc VS Code.
  • Kiến thức cơ bản về cấu trúc dự án Java và Maven.

Cài đặt GroupDocs.Search cho Java

Cài đặt qua Maven

Add the GroupDocs repository and the Search dependency to your pom.xml:

<repositories>
    <repository>
        <id>repository.groupdocs.com</id>
        <name>GroupDocs Repository</name>
        <url>https://releases.groupdocs.com/search/java/</url>
    </repository>
</repositories>

<dependencies>
    <dependency>
        <groupId>com.groupdocs</groupId>
        <artifactId>groupdocs-search</artifactId>
        <version>25.4</version>
    </dependency>
</dependencies>

Tải trực tiếp

Nếu bạn không muốn sử dụng Maven, tải JAR mới nhất từ trang phát hành chính thức: GroupDocs.Search for Java releases.

Các bước lấy giấy phép

  • Free Trial: Bắt đầu với bản dùng thử miễn phí để khám phá các tính năng.
  • Temporary License: Nhận qua GroupDocs’ official site.
  • Purchase: Mua giấy phép đầy đủ để sử dụng không giới hạn trong môi trường sản xuất.

Khởi tạo và Cấu hình Cơ bản

The Index class is the core component that represents a searchable index stored on disk. After creating an index folder, you instantiate the Index object to add, delete, or query documents:

String indexFolder = "YOUR_DOCUMENT_DIRECTORY/ObtainSearchResultInformation";
Index index = new Index(indexFolder);

Cách tìm kiếm Documents Java – Tính năng 1: Trích xuất thông tin kết quả tìm kiếm

Tính năng này giải thích cách chạy một truy vấn, lấy các tài liệu khớp, và nhận dữ liệu xuất hiện chi tiết cho mỗi thuật ngữ. Bằng cách làm theo các bước, bạn có thể xây dựng bảng điều khiển phân tích hoặc tạo báo cáo chi tiết từ kết quả tìm kiếm.

Bước 1: Tạo chỉ mục

The Index class is the top‑level object that stores searchable metadata on disk. Creating it points to a folder where all index files will reside:

String indexFolder = YOUR_DOCUMENT_DIRECTORY + "/ObtainSearchResultInformation";
Index index = new Index(indexFolder);
index.add(documentFolder);

Bước 2: Cấu hình Search Options (Bật tìm kiếm mờ)

SearchOptions lets you fine‑tune query behavior. Setting FuzzySearch to true enables approximate matching, which is useful for handling typos or OCR errors:

SearchOptions options = new SearchOptions();
options.getFuzzySearch().setEnabled(true);
options.getFuzzySearch().setFuzzyAlgorithm(new TableDiscreteFunction(3));

Bước 3: Thực thi tìm kiếm

Index.search runs the query against the prepared index and returns a SearchResult collection containing matched documents and term occurrences:

String query = "favourable OR \"ipsum dolor\"";
SearchResult result = index.search(query, options);

Đối tượng SearchResult chứa danh sách các tài liệu khớp với truy vấn và điểm liên quan của chúng.

Bước 4: Trích xuất các lần xuất hiện

Each SearchResult item provides getOccurrences() which returns the exact positions of the query terms inside the source file, allowing you to build analytics dashboards or detailed reports:

for (int i = 0; i < result.getDocumentCount(); i++) {
    FoundDocument document = result.getFoundDocument(i);
    for (FoundDocumentField field : document.getFoundFields()) {
        if (field.getTerms() != null) {
            for (String term : field.getTerms()) {
                int occurrences = field.getTermsOccurrences()[field.getTerms().indexOf(term)];
                System.out.println("Term: " + term + ", Occurrences: " + occurrences);
            }
        }
        if (field.getTermSequences() != null) {
            for (String[] terms : field.getTermSequences()) {
                int occurrences = field.getTermSequencesOccurrences()[ArrayUtils.indexOf(field.getTermSequences(), terms)];
                StringBuilder sequence = new StringBuilder();
                for (String term : terms) {
                    sequence.append(term).append(" ");
                }
                System.out.println("Phrase: " + sequence.toString() + ", Occurrences: " + occurrences);
            }
        }
    }
}

Tính năng 2: Đánh dấu các thuật ngữ tìm kiếm Java trong Tài liệu

Tạo một bản xem trước HTML trong đó mỗi kết quả trùng khớp được bao quanh bởi thẻ <mark>, cung cấp cho người dùng cuối các dấu hiệu trực quan ngay lập tức.

Bước 1: Thiết lập chỉ mục với nén cao

High compression reduces storage by up to 70 % while keeping query speed within milliseconds. Adjust the CompressionLevel property before indexing:

String indexFolder = YOUR_DOCUMENT_DIRECTORY + "/HighlightSearchResults";
IndexSettings settings = new IndexSettings();
settings.setTextStorageSettings(new TextStorageSettings(Compression.High));
Index index = new Index(indexFolder, settings);
index.add(documentFolder);

Bước 2: Thực hiện tìm kiếm và đánh dấu kết quả

After executing the search, call highlight() on the SearchResult object to produce an HTML file that highlights every occurrence of the query term. The highlight() method generates an HTML preview with matched terms wrapped in <mark> tags:

SearchResult result = index.search("solicitude");
if (result.getDocumentCount() > 0) {
    FoundDocument document = result.getFoundDocument(0);
    String path = YOUR_OUTPUT_DIRECTORY + "/Highlighted.html";
    OutputAdapter outputAdapter = new FileOutputAdapter(OutputFormat.Html, path);
    Highlighter highlighter = new DocumentHighlighter(outputAdapter);
    index.highlight(document, highlighter);
}

Ứng dụng thực tiễn

  1. Legal Document Review – Tìm các điều khoản cụ thể trong hàng ngàn hợp đồng trong vài giây.
  2. Academic Research – Trích xuất các cụm từ chính từ các bài nghiên cứu cho các bài tổng quan văn học.
  3. Customer Support – Xác định các vấn đề lặp lại trong lưu trữ email để cải thiện các trang FAQ.
  4. Content Management – Đánh dấu các từ khóa SEO trong bài viết và blog để kiểm tra biên tập nhanh.

Các yếu tố về hiệu năng

  • Compression: Nén cao giảm dung lượng lưu trữ nhưng có thể tăng sử dụng CPU; hãy benchmark với khối lượng công việc điển hình của bạn.
  • Memory Management: Lập chỉ mục tài liệu theo lô 500 – 1 000 tệp để giữ heap JVM trong tầm kiểm soát.
  • Index Refresh: Lập chỉ mục lại các tệp đã thay đổi mỗi đêm để đảm bảo kết quả tìm kiếm luôn cập nhật.

Kết luận

Hướng dẫn này đã trình bày cách implement groupdocs search java, trích xuất thông tin kết quả chi tiết, và highlight search terms java trong các bản xem trước HTML. Bằng cách làm theo các bước này, bạn có thể cung cấp trải nghiệm tìm kiếm nhanh chóng, thân thiện với người dùng cho bất kỳ kho lưu trữ tài liệu nào.

Các bước tiếp theo

  • Nhúng HTML đã đánh dấu vào giao diện web của bạn bằng thẻ <iframe> hoặc render phía máy chủ.
  • Thử nghiệm các SearchOptions bổ sung như SynonymSearch hoặc WildcardSearch.
  • Khám phá tài liệu tham chiếu API của GroupDocs.Search để tùy chỉnh điểm số, phân trang kết quả, và hỗ trợ đa ngôn ngữ.

Câu hỏi thường gặp

Q: What is GroupDocs.Search?
A: GroupDocs.Search là một SDK Java cho phép lập chỉ mục và tìm kiếm văn bản trên hơn 50 định dạng tài liệu, cung cấp khớp mờ và đánh dấu kết quả.

Q: How does fuzzy search work?
A: Nó chịu được một số lượng ký tự khác nhau có thể cấu hình, cho phép khớp với các từ bị viết sai hoặc lỗi OCR.

Q: Can I use GroupDocs.Search without a license?
A: Có, bản dùng thử miễn phí có sẵn, nhưng giấy phép đầy đủ là bắt buộc cho triển khai sản xuất.

Q: What file formats are supported?
A: PDF, DOCX, XLSX, PPTX, TXT, và nhiều hơn nữa — xem tài liệu chính thức để biết danh sách đầy đủ.

Q: How do I display highlighted results in a web application?
A: Phục vụ tệp HTML đã tạo trực tiếp hoặc nhúng nội dung của nó vào trang bằng thẻ <iframe> hoặc render phía máy chủ.


Cập nhật lần cuối: 2026-07-26
Được kiểm tra với: GroupDocs.Search 25.4
Tác giả: GroupDocs

Hướng dẫn liên quan