Skapa sökindex java med GroupDocs.Search för Java

I den här omfattande guiden kommer du att lära dig hur du create search index java applikationer med GroupDocs.Search för Java, och också se hur du highlight search results java så att användare omedelbart kan upptäcka matchningar i PDF‑filer, Office‑filer, HTML‑sidor och mer. Oavsett om du bygger ett lättvikts‑skrivbordsverktyg eller en hög‑genomströmning företags‑sökningstjänst, täcker stegen nedan allt från indexering av olika format till finjustering av prestanda och körning av ett Java‑boolean‑frågeexempel.

Snabb översikt

  • Index diverse document types – PDF‑filer, DOCX, PPTX, XLSX, HTML och 150+ andra format.
  • Run advanced queries – Boolean, fuzzy, wildcard, phrase, regex och faceted searches.
  • Leverage language processing – Synonyms, spell checking, homophone detection och custom dictionaries.
  • Integrate OCR – Extract text from scanned images and add it to the searchable index.
  • Optimize performance – Control memory usage, index size, and query response times for indexes that reach multi‑gigabyte scale.
  • Highlight results – Show matches directly in the original document or in an HTML preview with customizable colors and CSS classes.

Nedan är en utvald lista med dedikerade handledningar som guidar dig genom varje funktion steg för steg.

Snabba svar

  • What does “highlight search results java” do? Det markerar visuellt matchande termer i det ursprungliga dokumentet eller en genererad HTML‑förhandsgranskning, så att användare omedelbart kan hitta relevanta utdrag.
  • Which library provides faceted search java? GroupDocs.Search for Java includes built‑in faceted search support that groups results by metadata fields.
  • Can I implement OCR java with the same API? Ja—aktivera OCR‑motorn med en enda OcrOptions‑inställning så kommer samma indexeringsarbetsflöde att extrahera text från bilder.
  • Do I need a license for production use? En kommersiell licens krävs när provperioden löpt ut.
  • Is the API compatible with Java 17 and later? Den stöder fullt ut Java 8+, är testad på Java 17 och körs på alla JVM‑kompatibla plattformar.

Vad är “highlight search results java”?

Highlighting search results in Java means programmatically applying visual cues—such as background colors or bold styling—to the exact words or phrases that matched a user’s query. Denna teknik förkortar den tid användare spenderar på att skanna långa dokument och förbättrar den övergripande sökanvändbarheten.

Varför använda GroupDocs.Search för Java?

GroupDocs.Search for Java indexes and queries thousands of documents in under two seconds on a standard 8‑core server. Den stöder 150+ filformat, bearbetar multi‑gigabyte‑index utan att ladda hela samlingen i minnet, och erbjuder färdig OCR, faceted search och synonymhantering — allt via ett flytande, väl‑dokumenterat API.

Förutsättningar

  • Java 8 eller nyare (Java 17 rekommenderas)
  • Maven eller Gradle för beroendehantering
  • En giltig GroupDocs.Search för Java‑licens (provversion tillgänglig)

Steg‑för‑steg guide

Steg 1: konfigurera projektet

Skapa ett Maven‑ eller Gradle‑projekt och lägg till GroupDocs.Search‑beroendet. Placera din licensfil (GroupDocs.Search.lic) i src/main/resources‑mappen så att SDK:n kan läsa in den automatiskt.

Steg 2: skapa ett index

Index är kärnklassen som representerar ett sökbart arkiv på disk.

Index index = new Index("path/to/index/folder");

Efter att du har instansierat Index, anropa add för varje dokument du vill göra sökbart. SDK:n upptäcker automatiskt filtypen och extraherar text.

Steg 3: aktivera OCR (implement OCR java)

OcrOptions konfigurerar den inbyggda OCR‑motorn.

OcrOptions ocr = new OcrOptions();
ocr.setLanguage("eng");
ocr.setDpi(300);

Bifoga OcrOptions‑instansen till indexeringsanropet så att skannade bilder konverteras till sökbar text.

Steg 4: utför en sökfråga

SearchOptions bygger frågan du skickar till indexet.

SearchOptions options = new SearchOptions()
    .setQuery("invoice")
    .setBooleanOperator(BooleanOperator.AND)
    .setFuzzy(true);

Du kan kombinera ett Java boolean query example med faceted‑filter, jokertecken eller regex‑mönster för att ytterligare begränsa resultaten.

Steg 5: highlight search results java

Highlight är en verktygsklass som genererar en markerad version av det matchade dokumentet.

HighlightOptions highlight = new HighlightOptions()
    .setColor(Color.YELLOW)
    .setCssClass("search-highlight");
HighlightResult result = Highlight.apply(searchResult, highlight);

API:n returnerar antingen en modifierad PDF‑fil eller ett HTML‑snutt där varje matchande term är omsluten av den valda stilen.

Steg 6: granska och optimera

Använd den inbyggda statistik‑API:n för att övervaka indexstorlek, minnesförbrukning och frågelatens. Justera maxMemoryUsage eller aktivera komprimering (setCompression(true)) för att hålla indexet slimmat när du hanterar miljontals poster.

Vanliga problem och lösningar

  • No highlights appear: Verifiera att du har skickat ett HighlightOptions‑objekt med ett stödformat (HTML eller PDF).
  • OCR misses text: Säkerställ att språkpaket är installerade och att källbilderna uppfyller rekommendationen på minst 300 dpi.
  • Faceted search returns empty buckets: Bekräfta att fälten du avser att facetera på indexerades med Facet‑typen under steg 2.

Vanliga frågor

Q: Can I use faceted search java together with fuzzy matching?
A: Ja—du kan kedja facet‑filter och fuzzy‑frågor i samma SearchOptions‑builder, vilket låter dig begränsa resultaten samtidigt som stavfel tolereras.

Q: Does highlighting work on encrypted PDFs?
A: Det fungerar endast när du anger rätt lösenord vid tillägg av dokumentet till indexet; SDK:n dekrypterar då, markerar och krypterar om utdata.

Q: How large can an index become before performance degrades?
A: Biblioteket hanterar pålitligt multi‑gigabyte‑index; genom att aktivera komprimering och justera maxMemoryUsage kan du hålla frågetider under 200 ms även med 10 miljoner dokument.

Q: Is there a way to customize the highlight color?
A: Absolut. Använd HighlightOptions.setColor(Color.YELLOW) eller ange en anpassad CSS‑klass för HTML‑utdata via setCssClass.

Q: What version of GroupDocs.Search is tested with this guide?
A: Exemplen validerades med GroupDocs.Search för Java 23.9.

Relaterade ämnen du kan utforska

Översikt över Java-dokumentsökfunktioner

GroupDocs.Search för Java erbjuder en omfattande uppsättning funktioner för att bygga kraftfulla sökapplikationer:

  • Multi‑format support – 150+ in- och utdataformat, inklusive PDF, DOCX, PPT, XLS, HTML och bildfiler.
  • Advanced search types – Boolean, fuzzy, wildcard, phrase, regex och faceted search java‑alternativ.
  • Intelligent indexing – Snabb, konfigurerbar dokumentindexering med valfri komprimering.
  • Language processing – Synonymdetektering, stavningskontroll och homofonigenkänning.
  • OCR support – Extrahera och sök text från bilder och skannade dokument (implement OCR java).
  • Performance optimization – Justerbart minnesbruk och frågehastighet för multi‑gigabyte‑index.
  • Result highlighting – Visuellt markera sökträffar i originaldokument (highlight search results java).
  • Dictionary support – Anpassade ordböcker för specialiserad terminologi och domäner.
  • Distributed search – Bygg skalbara, sharded söklösningar med nätverksfunktioner.
  • Blazing speed – Bearbeta och sök 10 000 dokument på under 2 sekunder på en vanlig server.

Lärresurser


Senast uppdaterad: 2026-08-26
Testat med: GroupDocs.Search för Java 23.9
Författare: GroupDocs