Wyłączanie słów stop w Javie – Dodawanie dokumentów do indeksu z GroupDocs
W tym samouczku dowiesz się, jak disable stop words java podczas dodawania swoich plików do przeszukiwalnego indeksu przy użyciu GroupDocs.Search dla Javy. Wyłączając wbudowany filtr słów stop, każdy token — w tym powszechne słowa takie jak „on”, „by” lub „the” — staje się przeszukiwalny, co dramatycznie poprawia trafność wyników w specjalistycznych domenach, takich jak umowy prawne, katalogi e‑commerce czy podręczniki techniczne.
Szybkie odpowiedzi
- What does “add documents to index” mean? Oznacza to ładowanie Twoich plików źródłowych do przeszukiwalnego indeksu, aby można było je efektywnie zapytać.
- Why would I disable stop words? Aby uwzględnić powszechne słowa (np. „on”, „the”) w wyszukiwaniach, gdy te terminy są istotne dla Twojej domeny.
- Which library version is required? GroupDocs.Search for Java 25.4 lub nowsza.
- Do I need a license? Darmowa wersja próbna działa do oceny; stała licencja jest wymagana w środowisku produkcyjnym.
- Can I use this in a Maven project? Tak – wystarczy dodać repozytorium i zależność pokazane poniżej.
Czym są słowa stop w wyszukiwaniu i dlaczego możesz chcieć je wyłączyć?
Słowa stop to terminy o wysokiej częstotliwości, które wiele silników wyszukiwania automatycznie filtruje, aby przyspieszyć przetwarzanie zapytań. Ich wyłączenie zapewnia, że każde słowo — w tym tradycyjnie pomijane — przyczynia się do indeksu wyszukiwania, co jest niezbędne, gdy te słowa niosą znaczenie specyficzne dla domeny. Na przykład w umowie prawnej słowo „by” może rozróżniać strony, a w katalogu produktów „on” może być częścią nazwy modelu.
Jak działa dodawanie dokumentów do indeksu w GroupDocs.Search?
Gdy dodajesz dokumenty, GroupDocs.Search odczytuje każdy plik, tokenizuje jego zawartość i przechowuje tokeny w zoptymalizowanym odwróconym indeksie. Ta struktura umożliwia pobieranie w czasie poniżej sekundy nawet dla kolekcji zawierających setki tysięcy plików. Biblioteka obsługuje także aktualizacje przyrostowe, dzięki czemu możesz utrzymywać indeks aktualny bez konieczności ponownego budowania od podstaw.
Wymagania wstępne
- Wymagane biblioteki: GroupDocs.Search for Java 25.4 (or newer).
- Środowisko programistyczne: IntelliJ IDEA, Eclipse, lub dowolne IDE Java, które preferujesz.
- Podstawowa wiedza: Znajomość składni Java oraz koncepcji indeksowania.
Konfiguracja GroupDocs.Search dla Javy
Instalacja Maven
Jeśli używasz Maven, umieść poniższy kod w swoim pom.xml:
<repositories>
<repository>
<id>repository.groupdocs.com</id>
<name>GroupDocs Repository</name>
<url>https://releases.groupdocs.com/search/java/</url>
</repository>
</repositories>
<dependencies>
<dependency>
<groupId>com.groupdocs</groupId>
<artifactId>groupdocs-search</artifactId>
<version>25.4</version>
</dependency>
</dependencies>
Bezpośrednie pobranie
Alternatywnie, pobierz najnowszą wersję z GroupDocs.Search for Java releases.
Kroki uzyskania licencji
- Free Trial – rozpocznij testowanie od razu.
- Temporary License – uzyskaj klucz czasowo ograniczony, aby uzyskać pełną funkcjonalność.
- Purchase – zdobądź stałą licencję do użytku produkcyjnego.
Podstawowa inicjalizacja i konfiguracja
IndexSettings jest klasą konfiguracyjną, która definiuje sposób budowania indeksu, wyszukiwania oraz które funkcje są włączone.
Utwórz instancję IndexSettings, aby kontrolować zachowanie indeksu:
import com.groupdocs.search.IndexSettings;
// Create an instance of IndexSettings
IndexSettings settings = new IndexSettings();
Jak wyłączyć słowa stop w wyszukiwaniu (Java)?
IndexSettings jest obiektem konfiguracyjnym, który kontroluje zachowanie indeksu wyszukiwania. Domyślnie włącza wbudowany filtr słów stop. Aby wyłączyć ten filtr, wywołaj metodę setUseStopWords(false) na instancji IndexSettings. To pojedyncze wywołanie wyłącza usuwanie słów stop, zapewniając, że każdy token — w tym powszechne słowa takie jak „on” lub „the” — jest indeksowany i może być przeszukiwany.
Jak dodać dokumenty do indeksu
Dodawanie dokumentów do indeksu odbywa się poprzez utworzenie obiektu Index z żądanymi IndexSettings, a następnie wywołanie jego metody add dla każdego pliku lub folderu. Biblioteka odczytuje każdy dokument, tokenizuje jego zawartość i przechowuje powstałe terminy w odwróconym indeksie, czyniąc je natychmiast przeszukiwalnymi. Możesz skierować indeks do określonego katalogu wyjściowego i określić folder źródłowy zawierający pliki do indeksowania.
Definiowanie katalogu wyjściowego
// Disable the use of stop words
tsettings.setUseStopWords(false);
Określanie katalogu dokumentów
import com.groupdocs.search.Index;
// Define the path to the output directory for indexing
String indexFolder = "YOUR_OUTPUT_DIRECTORY\\IndexingWithStopWords";
// Create an index at the specified location with the configured settings
Index index = new Index(indexFolder, settings);
Wykonywanie zapytania wyszukiwania
// Define the path to your document directory
String documentsFolder = "YOUR_DOCUMENT_DIRECTORY";
// Add all documents in the specified folder to the index
index.add(documentsFolder);
Ponieważ disable stop words java jest aktywne, zapytanie zawierające termin „on” zostanie ocenione, zwracając dopasowania, które w przeciwnym razie byłyby ignorowane przez domyślny filtr.
Praktyczne zastosowania
- Enterprise Document Search – Zachowaj krytyczną terminologię, która zostałaby usunięta przez domyślne listy słów stop.
- E‑commerce Platforms – Zwiększ wykrywalność produktów, indeksując każde słowo w opisach, numerach modeli i specyfikacjach.
- Legal Research Tools – Uchwyć każdy termin prawny, nawet te zwykle traktowane jako słowa stop, aby nie przegapić kluczowych klauzul.
Rozważania dotyczące wydajności
- Optimization Tips: Regularnie aktualizuj i przycinaj indeks, aby utrzymać wysoką prędkość wyszukiwania. GroupDocs.Search może obsłużyć do 1 miliona dokumentów, zachowując czasy zapytań poniżej sekundy.
- Resource Usage: Monitoruj rozmiar sterty JVM; duże indeksy mogą wymagać maksymalnej sterty (
-Xmx) 4 GB lub więcej. - Java Memory Management: Używaj opcji przechowywania poza stertą (off‑heap) dla bardzo dużych korpusów, aby utrzymać zużycie sterty (on‑heap) poniżej 2 GB.
Typowe problemy i rozwiązania
| Objaw | Prawdopodobna przyczyna | Rozwiązanie |
|---|---|---|
| Brak wyników dla powszechnych słów | setUseStopWords(true) (default) | Wywołaj setUseStopWords(false) jak pokazano powyżej. |
| Błędy out‑of‑memory podczas indeksowania | Indeksowanie zbyt wielu dużych plików jednocześnie | Indeksuj pliki w partiach; zwiększ opcję JVM -Xmx. |
| Wyszukiwanie zwraca nieaktualne dane | Indeks nie został odświeżony po dodaniu nowych plików | Wywołaj index.update() lub ponownie dodaj zmienione dokumenty. |
Najczęściej zadawane pytania
Q: Co to są słowa stop?
A: Słowa stop to powszechne terminy (np. „the”, „is”, „on”), które wiele silników wyszukiwania ignoruje, aby przyspieszyć zapytania. Ich wyłączenie pozwala traktować każdy token jako przeszukiwalny.
Q: Dlaczego wyłączać słowa stop w indeksach wyszukiwania?
A: Gdy wymagana jest dokładna zgodność fraz — na przykład w dokumentach prawnych lub technicznych — każde słowo ma znaczenie, więc należy uwzględniać słowa stop.
Q: Jak GroupDocs.Search radzi sobie z dużymi zestawami danych?
A: Biblioteka używa zoptymalizowanych struktur danych i indeksowania przyrostowego, aby utrzymać niskie zużycie pamięci, nawet przy milionach dokumentów.
Q: Czy mogę zintegrować GroupDocs.Search z innymi aplikacjami Java?
A: Tak, API jest zaprojektowane tak, aby łatwo integrować się z dowolnym systemem opartym na Javie, od usług internetowych po aplikacje desktopowe.
Q: Co zrobić, gdy wyniki wyszukiwania nie są dokładne?
A: Sprawdź, czy indeks zawiera wszystkie wymagane pliki (add documents to index), upewnij się, że filtrowanie słów stop jest wyłączone w razie potrzeby i rozważ przebudowanie indeksu po większych zmianach.
Dodatkowe zasoby
- Documentation: GroupDocs Search Documentation
- API Reference: GroupDocs API Reference
- Download: Get the latest GroupDocs.Search for Java
- GitHub Repository: Explore on GitHub
- Free Support: Join GroupDocs Forum
- Temporary License: Apply for a Temporary License
Korzystając z tego przewodnika, teraz wiesz, jak add documents to index i disable stop words java dostarczyć bardziej dokładne wyniki wyszukiwania w aplikacjach Java.
Last Updated: 2026-07-07
Tested With: GroupDocs.Search for Java 25.4
Author: GroupDocs
import com.groupdocs.search.results.SearchResult;
// Define your search query
tString query = "on";
// Perform the search operation using the index and the specified query
SearchResult result = index.search(query);