Desactivar palabras vacías Java – Añadir documentos al índice con GroupDocs

En este tutorial descubrirá cómo disable stop words java mientras agrega sus archivos a un índice buscable con GroupDocs.Search for Java. Al desactivar el filtro de palabras vacías incorporado, cada token—incluyendo palabras comunes como “on”, “by” o “the”—se vuelve buscable, lo que mejora drásticamente la relevancia de los resultados para dominios especializados como contratos legales, catálogos de comercio electrónico o manuales técnicos.

Respuestas rápidas

  • ¿Qué significa “add documents to index”? Significa cargar sus archivos fuente en un índice buscable para que puedan consultarse de manera eficiente.
  • ¿Por qué desactivaría las palabras vacías? Para incluir palabras comunes (p. ej., “on”, “the”) en las búsquedas cuando esos términos son significativos para su dominio.
  • ¿Qué versión de la biblioteca se requiere? GroupDocs.Search for Java 25.4 o posterior.
  • ¿Necesito una licencia? Una prueba gratuita funciona para evaluación; se requiere una licencia permanente para producción.
  • ¿Puedo usar esto en un proyecto Maven? Sí, solo agregue el repositorio y la dependencia que se muestra a continuación.

Qué son las palabras vacías en la búsqueda y por qué podría querer desactivarlas

Las palabras vacías son términos de alta frecuencia que muchos motores de búsqueda filtran automáticamente para acelerar el procesamiento de consultas. Desactivarlas garantiza que cada palabra—incluidas las que tradicionalmente se ignoran—contribuya al índice de búsqueda, lo cual es esencial cuando esas palabras tienen un significado específico del dominio. Por ejemplo, en un contrato legal la palabra “by” puede distinguir a las partes, y en un catálogo de productos “on” puede ser parte del nombre de un modelo.

Cómo funciona la adición de documentos al índice en GroupDocs.Search

Cuando agrega documentos, GroupDocs.Search lee cada archivo, tokeniza el contenido y almacena los tokens en un índice invertido optimizado. Esta estructura permite recuperaciones en menos de un segundo incluso para colecciones que contienen cientos de miles de archivos. La biblioteca también admite actualizaciones incrementales, por lo que puede mantener el índice actualizado sin reconstruirlo desde cero.

Requisitos previos

  • Bibliotecas requeridas: GroupDocs.Search for Java 25.4 (o más reciente).
  • Entorno de desarrollo: IntelliJ IDEA, Eclipse, o cualquier IDE de Java que prefiera.
  • Conocimientos básicos: Familiaridad con la sintaxis de Java y el concepto de indexación.

Configuración de GroupDocs.Search para Java

Instalación con Maven

Si está usando Maven, incluya lo siguiente en su pom.xml:

<repositories>
    <repository>
        <id>repository.groupdocs.com</id>
        <name>GroupDocs Repository</name>
        <url>https://releases.groupdocs.com/search/java/</url>
    </repository>
</repositories>

<dependencies>
    <dependency>
        <groupId>com.groupdocs</groupId>
        <artifactId>groupdocs-search</artifactId>
        <version>25.4</version>
    </dependency>
</dependencies>

Descarga directa

Alternativamente, descargue la última versión desde GroupDocs.Search for Java releases.

Pasos para obtener la licencia

  • Prueba gratuita – comience a probar de inmediato.
  • Licencia temporal – obtenga una clave de tiempo limitado para funcionalidad completa.
  • Compra – adquiera una licencia permanente para uso en producción.

Inicialización y configuración básicas

IndexSettings es una clase de configuración que define cómo se construye el índice, se busca y qué características están habilitadas.

Cree una instancia de IndexSettings para controlar el comportamiento del índice:

import com.groupdocs.search.IndexSettings;

// Create an instance of IndexSettings
IndexSettings settings = new IndexSettings();

Cómo desactivar palabras vacías en la búsqueda (Java)?

IndexSettings es el objeto de configuración que controla el comportamiento del índice de búsqueda. Por defecto habilita un filtro de palabras vacías incorporado. Para desactivar este filtro, llame al método setUseStopWords(false) en la instancia de IndexSettings. Esta única llamada desactiva la eliminación de palabras vacías, garantizando que cada token—incluidas palabras comunes como “on” o “the”—se indexe y pueda ser consultado.

Cómo agregar documentos al índice

Agregar documentos al índice se realiza creando un objeto Index con los IndexSettings deseados y luego invocando su método add para cada archivo o carpeta. La biblioteca lee cada documento, tokeniza su contenido y almacena los términos resultantes en el índice invertido, haciéndolos buscables al instante. Puede apuntar el índice a un directorio de salida específico y especificar la carpeta fuente que contiene los archivos a indexar.

Definiendo el directorio de salida

// Disable the use of stop words
tsettings.setUseStopWords(false);

Especificando el directorio de documentos

import com.groupdocs.search.Index;

// Define the path to the output directory for indexing
String indexFolder = "YOUR_OUTPUT_DIRECTORY\\IndexingWithStopWords";

// Create an index at the specified location with the configured settings
Index index = new Index(indexFolder, settings);

Realizando una consulta de búsqueda

// Define the path to your document directory
String documentsFolder = "YOUR_DOCUMENT_DIRECTORY";

// Add all documents in the specified folder to the index
index.add(documentsFolder);

Debido a que disable stop words java está activo, una consulta que contenga el término “on” será evaluada, devolviendo coincidencias que de otro modo serían ignoradas por el filtro predeterminado.

Aplicaciones prácticas

  1. Búsqueda de documentos empresariales – Preserve la terminología crítica que sería eliminada por las listas de palabras vacías predeterminadas.
  2. Plataformas de comercio electrónico – Mejore la descubribilidad de productos indexando cada palabra en descripciones, números de modelo y especificaciones.
  3. Herramientas de investigación legal – Capture cada término legal, incluso aquellos comúnmente tratados como palabras vacías, para evitar perder cláusulas cruciales.

Consideraciones de rendimiento

  • Consejos de optimización: Actualice y podar su índice regularmente para mantener alta la velocidad de búsqueda. GroupDocs.Search puede manejar hasta 1 millón de documentos manteniendo tiempos de consulta subsegundo.
  • Uso de recursos: Monitoree el tamaño del heap de JVM; índices grandes pueden requerir un heap máximo (-Xmx) de 4 GB o más.
  • Gestión de memoria en Java: Use opciones de almacenamiento fuera del heap para corpora muy grandes y mantener la huella en el heap por debajo de 2 GB.

Problemas comunes y soluciones

SíntomaCausa probableSolución
No hay resultados para palabras comunessetUseStopWords(true) (predeterminado)Llame a setUseStopWords(false) como se muestra arriba.
Errores de falta de memoria durante la indexaciónIndexar demasiados archivos grandes a la vezIndexe los archivos en lotes; aumente la opción JVM -Xmx.
La búsqueda devuelve datos obsoletosEl índice no se actualiza después de agregar nuevos archivosLlame a index.update() o vuelva a agregar los documentos modificados.

Preguntas frecuentes

Q: ¿Qué son las palabras vacías?
A: Las palabras vacías son términos comunes (p. ej., “the”, “is”, “on”) que muchos motores de búsqueda ignoran para acelerar las consultas. Desactivarlas le permite tratar cada token como buscable.

Q: ¿Por qué desactivar las palabras vacías en los índices de búsqueda?
A: Cuando se requiere coincidencia exacta de frases —como en documentos legales o técnicos— cada palabra tiene significado, por lo que necesita incluir las palabras vacías.

Q: ¿Cómo maneja GroupDocs.Search grandes conjuntos de datos?
A: La biblioteca usa estructuras de datos optimizadas e indexación incremental para mantener bajo el uso de memoria, incluso con millones de documentos.

Q: ¿Puedo integrar GroupDocs.Search con otras aplicaciones Java?
A: Sí, la API está diseñada para integrarse fácilmente en cualquier sistema basado en Java, desde servicios web hasta aplicaciones de escritorio.

Q: ¿Qué debo hacer si mis resultados de búsqueda no son precisos?
A: Verifique que el índice incluya todos los archivos necesarios (add documents to index), asegúrese de que el filtrado de palabras vacías esté desactivado cuando sea necesario, y considere reconstruir el índice después de cambios importantes.

Recursos adicionales

Siguiendo esta guía, ahora sabe cómo add documents to index y disable stop words java para ofrecer resultados de búsqueda más precisos en sus aplicaciones Java.


Última actualización: 2026-07-07
Probado con: GroupDocs.Search for Java 25.4
Autor: GroupDocs

import com.groupdocs.search.results.SearchResult;

// Define your search query
tString query = "on";

// Perform the search operation using the index and the specified query
SearchResult result = index.search(query);

Tutoriales relacionados