Erstelle durchsuchbaren Index java: Dokumente hinzufügen – Suche mit Groß‑/Kleinschreibung

In modernen Java‑Anwendungen ist das Erstellen eines durchsuchbaren Index java die Grundlage für schnelle, präzise Abrufe von Informationen aus großen Dokumentensammlungen. Dieses Tutorial zeigt Ihnen, wie Sie Dokumente zu einem Index hinzufügen, die Suche mit Groß‑/Kleinschreibung aktivieren und den Prozess mit GroupDocs.Search feinabstimmen. Egal, ob Sie ein Rechtsarchiv, einen E‑Commerce‑Katalog oder ein Content‑Management‑System aufbauen – diese Schritte helfen Ihnen, genaue Ergebnisse zu liefern, die Nutzer zufrieden stellen.

Schnelle Antworten

  • Was ist der erste Schritt, um mit der Suche zu beginnen? Dokumente zu einem Index hinzufügen mit index.add(...).
  • Wie aktivieren Sie die Suche mit Groß‑/Kleinschreibung? Setzen Sie options.setUseCaseSensitiveSearch(true).
  • Können Sie über mehrere Verzeichnisse hinweg suchen? Ja – rufen Sie index.add() für jeden Ordner auf, den Sie einbeziehen möchten.
  • Welche Methode ermöglicht die Suche mit Objekten? Verwenden Sie SearchQuery.createWordQuery(...).
  • Benötigen Sie eine Lizenz für Tests? Eine temporäre Lizenz ist für Testzwecke verfügbar.

Was bedeutet „Dokumente zum Index hinzufügen“?

Dokumente zu einem Index hinzuzufügen bedeutet, Ihre Quelldateien (PDFs, Word‑Dokumente, Klartext usw.) in GroupDocs.Search zu speisen, damit es eine durchsuchbare Datenstruktur aufbauen kann. Der Index speichert tokenisierte Begriffe, Positionen und Metadaten, sodass die Engine schnelle Abfragen, einschließlich solcher mit Groß‑/Kleinschreibung, ausführen und Ergebnisse effizient ranken kann.

Warum die Suche mit Groß‑/Kleinschreibung in Java aktivieren?

Die Aktivierung der Suche mit Groß‑/Kleinschreibung stellt sicher, dass die Engine Begriffe unterscheidet, die sich nur durch die Schreibweise unterscheiden – ein kritischer Aspekt in Bereichen, in denen die Großschreibung Bedeutung trägt. Sie ermöglicht exakte Begriffstreffer, unterstützt regulatorische Anforderungen und erhöht die Relevanz, indem Ergebnisse zurückgegeben werden, die exakt der Schreibweise der Benutzeranfrage entsprechen.

  • Exakte Begriffstreffer – z. B. „Apple“ (Unternehmen) vs. „apple“ (Frucht).
  • Regulatorische Konformität – viele Branchen verlangen präzise Phrasentreffer.
  • Verbesserte Relevanz – technische und juristische Nutzer erwarten häufig fallabhängige Ergebnisse.

Voraussetzungen

  • JDK 17 oder höher (empfohlen)
  • Maven für das Abhängigkeitsmanagement
  • Eine IDE wie IntelliJ IDEA oder Eclipse
  • Grundlegende Kenntnisse in der Java‑Programmierung

Einrichtung von GroupDocs.Search für Java

Das folgende Maven‑Snippet fügt das GroupDocs.Search‑Repository und die erforderliche Abhängigkeit zu Ihrem Projekt hinzu.

<repositories>
    <repository>
        <id>repository.groupdocs.com</id>
        <name>GroupDocs Repository</name>
        <url>https://releases.groupdocs.com/search/java/</url>
    </repository>
</repositories>

<dependencies>
    <dependency>
        <groupId>com.groupdocs</groupId>
        <artifactId>groupdocs-search</artifactId>
        <version>25.4</version>
    </dependency>
</dependencies>

Alternativ können Sie die neueste Version direkt von GroupDocs.Search for Java releases herunterladen.

Lizenzierung

Um mit einer Testversion zu starten, besuchen Sie GroupDocs und erwerben Sie eine temporäre Lizenz. Damit können Sie alle Funktionen ohne Einschränkungen testen.

Wie man einen durchsuchbaren Index java erstellt – Textabfrage‑Suche

Schritt 1: Einen Index erstellen und Ihre Dokumente hinzufügen

Die Klasse Index repräsentiert einen durchsuchbaren Speicherbereich auf der Festplatte, in dem Dokumente indexiert werden.

String indexFolder = YOUR_OUTPUT_DIRECTORY + "/CaseSensitiveSearch/QueryInTextForm";
Index index = new Index(indexFolder);
index.add(YOUR_DOCUMENT_DIRECTORY); // Add documents to the index

Pro Tipp: Sie können index.add() mehrmals aufrufen, um nach mehreren Verzeichnissen zu suchen in einem einzigen Index.

Schritt 2: Suche mit Groß‑/Kleinschreibung aktivieren

SearchOptions konfiguriert, wie Abfragen verarbeitet werden, einschließlich Groß‑/Kleinschreibung und anderer Suchverhalten.

SearchOptions options = new SearchOptions();
options.setUseCaseSensitiveSearch(true);

Schritt 3: Eine textbasierte Abfrage mit Groß‑/Kleinschreibung ausführen

SearchQuery erstellt das Abfrageobjekt, das die Engine gegen den Index evaluiert.

String query = "Advantages";
SearchResult result = index.search(query, options);

// Output results
for (FoundDocument doc : result.getDocuments()) {
    System.out.println("Document: " + doc.getDocumentInfo().getFilePath());
}

Die Schleife gibt den vollständigen Pfad jedes Dokuments aus, das den exakt übereinstimmenden Begriff enthält.

Wie man einen durchsuchbaren Index java erstellt – Objektabfrage‑Suche

Schritt 1: Einen zweiten Index initialisieren (optional)

Eine zweite Index‑Instanz kann erstellt werden, um objektbasierte Suchen von Klartext‑Suchen zu isolieren.

String indexFolder = YOUR_OUTPUT_DIRECTORY + "/CaseSensitiveSearch/QueryInObjectForm";
Index index = new Index(indexFolder);
index.add(YOUR_DOCUMENT_DIRECTORY); // Add documents to the index

Schritt 2: Die Option für Groß‑/Kleinschreibung wiederverwenden

SearchOptions kann über verschiedene Abfragetypen hinweg wiederverwendet werden, um eine konsistente Fallbehandlung zu gewährleisten.

SearchOptions options = new SearchOptions();
options.setUseCaseSensitiveSearch(true);

Schritt 3: Eine Objektabfrage erstellen und ausführen

WordQuery stellt eine wortbasierte Suche dar, die mit anderen Abfragetypen für komplexe Suchen kombiniert werden kann.

SearchQuery query = SearchQuery.createWordQuery("Advantages");
SearchResult result = index.search(query, options);

// Output results
for (FoundDocument doc : result.getDocuments()) {
    System.out.println("Document: " + doc.getDocumentInfo().getFilePath());
}

Die Verwendung von createWordQuery ermöglicht es Ihnen, später mit Phrase‑, Wildcard‑ oder Booleschen Abfragen zu kombinieren, um komplexere Szenarien zu realisieren.

Praktische Anwendungsfälle

  • Rechtsdokumenten‑Management: Abrufen von fall‑spezifischen Gesetzen, bei denen die Großschreibung wichtig ist.
  • E‑Commerce‑Plattformen: Unterscheiden von Produkt‑SKUs wie „PRO‑X“ vs. „pro‑x“.
  • Content‑Management‑Systeme (CMS): Sicherstellen, dass Autoren genaue Überschriften oder Tags finden.

Leistungsüberlegungen

  • Den Index aktuell halten – neu indexieren, wenn neue Dateien hinzugefügt oder vorhandene geändert werden.
  • Speicherauslastung überwachen – große Korpora profitieren von inkrementellem Indexieren und richtiger JVM‑Heap‑Größe.
  • Java‑Garbage‑Collector nutzen – Index‑Objekte freigeben, wenn sie nicht mehr benötigt werden.

Häufige Probleme und Lösungen

ProblemLösung
useCaseSensitiveSearch scheint ignoriert zu werdenVergewissern Sie sich, dass Sie die neueste GroupDocs.Search‑Version verwenden und dass der Index nach Änderung der Option neu aufgebaut wurde.
Keine Ergebnisse für einen bekannten BegriffStellen Sie sicher, dass die Schreibweise des Begriffs exakt übereinstimmt und dass das Dokument erfolgreich zum Index hinzugefügt wurde.
Das Durchsuchen vieler Ordner verlangsamt die SucheFügen Sie jeden Ordner einzeln mit index.add() hinzu und erwägen Sie, den Index für sehr große Datensätze in Shards aufzuteilen.

Häufig gestellte Fragen

F: Wie gehe ich mit großen Datensätzen in GroupDocs.Search um?
A: Nutzen Sie Index‑Partitionierung, passen Sie die JVM‑Speichereinstellungen an und komprimieren Sie den Index periodisch, um die Leistung optimal zu halten.

F: Kann ich gleichzeitig über mehrere Verzeichnisse hinweg suchen?
A: Ja – rufen Sie index.add() für jedes Verzeichnis auf, das Sie einbeziehen möchten, und führen Sie dann eine einzige Abfrage gegen den kombinierten Index aus.

F: Welche typischen Fallstricke gibt es beim Einrichten von Suche mit Groß‑/Kleinschreibung?
A: Das Vergessen, den Index nach Aktivierung von useCaseSensitiveSearch neu zu bauen, oder die falsche Schreibweise im Abfrage‑String zu verwenden.

F: Wie kann ich Suchfehler beheben?
A: Prüfen Sie die von GroupDocs.Search erzeugten Log‑Dateien auf Stack‑Traces und stellen Sie sicher, dass alle Maven‑Abhängigkeiten korrekt aufgelöst wurden.

F: Ist GroupDocs.Search für Echtzeit‑Anwendungen geeignet?
A: Mit geeigneten Indexierungsstrategien (inkrementelle Updates und In‑Memory‑Caching) kann es nahezu Echtzeit‑Suchergebnisse liefern.

Ressourcen


Zuletzt aktualisiert: 2026-08-10
Getestet mit: GroupDocs.Search 25.4
Autor: GroupDocs

Verwandte Tutorials