Comment créer un index de documents et ajouter des documents avec GroupDocs.Search pour Java
Si vous avez besoin de créer un index de documents qui vous permettent de rechercher instantanément des milliers de PDF, DOCX, TXT et d’autres formats, GroupDocs.Search pour Java vous offre une API claire pour le faire. Dans ce tutoriel, vous apprendrez comment configurer le dossier d’index, ajouter des documents à l’index, et optimiser les performances de recherche pour des scénarios réels de recherche en texte intégral en java.
Réponses rapides
- Quelle est la première étape ? Installez GroupDocs.Search via Maven ou téléchargez la bibliothèque.
- Comment ajouter des documents à l’index ? Appelez
index.add(yourDocumentsFolder)après avoir initialisé l’index. - Quel dossier doit contenir l’index ? Utilisez un dossier dédié comme
outputet configurez‑le avecnew Index(indexFolder). - Puis‑je améliorer la vitesse de recherche ? Oui—maintenez régulièrement l’index et exécutez l’indexation dans un thread d’arrière‑plan.
- Ai‑je besoin d’une licence ? Une licence d’essai ou temporaire fonctionne pour les tests ; une licence complète est requise pour la production.
Qu’est‑ce qu’un index de documents ?
Un index de documents est un magasin de données structuré qui contient des jetons recherchables extraits de vos fichiers sources. En créant un index de documents, vous permettez des requêtes rapides en texte intégral sur tout le contenu indexé sans analyser chaque fichier à l’exécution.
Pourquoi utiliser GroupDocs.Search pour Java ?
- High performance – les optimisations intégrées maintiennent une latence faible même avec des millions de fichiers.
- Easy integration – API simple pour créer des index, ajouter des documents et exécuter des requêtes.
- Scalable architecture – fonctionne sur site ou dans le cloud, et peut être personnalisé avec des fonctionnalités de synonymes ou de classement.
- Java full text search – prend en charge un large éventail de formats prêts à l’emploi.
Prérequis
- Java Development Kit (JDK) 8 ou supérieur.
- IDE tel que IntelliJ IDEA ou Eclipse.
- Maven pour la gestion des dépendances.
- Familiarité de base avec la programmation Java.
Configuration de GroupDocs.Search pour Java
Installation via Maven
Ajoutez ce qui suit à votre fichier pom.xml :
<repositories>
<repository>
<id>repository.groupdocs.com</id>
<name>GroupDocs Repository</name>
<url>https://releases.groupdocs.com/search/java/</url>
</repository>
</repositories>
<dependencies>
<dependency>
<groupId>com.groupdocs</groupId>
<artifactId>groupdocs-search</artifactId>
<version>25.4</version>
</dependency>
</dependencies>
Téléchargement direct
Sinon, téléchargez la dernière version directement depuis GroupDocs.Search for Java releases.
Obtention de licence
- Free Trial – Essai gratuit – explorez toutes les fonctionnalités sans engagement.
- Temporary License – Licence temporaire – prolongez les tests au‑delà de la période d’essai.
- Purchase – Achat – obtenez une licence complète pour une utilisation en production.
Initialisation de base
import com.groupdocs.search.Index;
public class InitializeGroupDocs {
public static void main(String[] args) {
// Create an index in the specified folder
String indexFolder = "YOUR_DOCUMENT_DIRECTORY\\output";
Index index = new Index(indexFolder);
System.out.println("GroupDocs.Search initialized successfully.");
}
}
Comment ajouter des documents à l’index
Étape 1 : Configurer le dossier d’index et le dossier source
String indexFolder = "YOUR_DOCUMENT_DIRECTORY\\output\\AdvancedUsage\\Searching\\SynonymSearch";
String documentsFolder = "YOUR_DOCUMENT_DIRECTORY"; // Replace with your actual document path
Explication : indexFolder est l’endroit où l’index recherchable sera stocké, tandis que documentsFolder pointe vers les fichiers que vous souhaitez ajouter des documents à l’index.
Étape 2 : Créer l’index (configurer le dossier d’index)
Index index = new Index(indexFolder);
Explication : Cette ligne crée une nouvelle instance d’index qui écrit ses données dans le dossier que vous avez configuré.
Étape 3 : Ajouter des documents pour l’indexation
index.add(documentsFolder);
Explication : La méthode add parcourt documentsFolder et ajoute des documents à l’index, rendant leur contenu recherchable.
Conseils de dépannage
- Missing dependencies – vérifiez à nouveau les entrées Maven dans
pom.xml. - Invalid folder path – assurez‑vous que
indexFolderetdocumentsFolderexistent et sont accessibles par la JVM.
Gestion de gros documents
Lorsque vous travaillez avec des PDF de plusieurs gigaoctets ou d’importantes collections de DOCX, prenez en compte les points suivants :
- Batch processing – traitement par lots – divisez le dossier source en sous‑dossiers plus petits et appelez
index.add()pour chaque lot. - Background indexing – indexation en arrière‑plan – exécutez le code d’indexation sur un thread séparé afin que votre application principale reste réactive.
- Heap tuning – ajustement du tas – augmentez le paramètre JVM
-Xmxpour fournir suffisamment de mémoire au processus pour les gros fichiers.
Optimisation des performances de recherche
Pour optimiser les performances de recherche et améliorer la latence de recherche, suivez ces meilleures pratiques :
- Regularly merge index segments – fusionnez régulièrement les segments d’index – cela réduit le nombre de lectures disque lors des requêtes.
- Use
index.update()(if available) after bulk additions instead of recreating the index from scratch. – Utilisezindex.update()(si disponible) après des ajouts massifs au lieu de recréer l’index à partir de zéro. - Monitor heap usage – Surveillez l’utilisation du tas – les gros index peuvent consommer une mémoire importante ; ajustez les options JVM en conséquence.
- Enable caching for frequently run queries if your application pattern permits it. – Activez la mise en cache pour les requêtes exécutées fréquemment si le modèle de votre application le permet.
Applications pratiques
- Enterprise Document Management – récupérez rapidement les contrats, politiques ou fichiers RH.
- Legal Research – localisez les dossiers de cas et les précédents avec une latence minimale.
- Academic Libraries – permettez aux chercheurs de rechercher parmi des milliers de publications scientifiques.
Problèmes courants et solutions
| Problème | Solution |
|---|---|
| Erreurs de mémoire insuffisante lors de l’indexation massive | Divisez le dossier source en lots plus petits et indexez chaque lot séparément. |
| La recherche renvoie des résultats obsolètes | Rouvrez l’objet Index après de grandes mises à jour ou appelez index.update() si disponible. |
| Licence non reconnue | Vérifiez que le chemin du fichier de licence est correct et que la version de la licence correspond à la version de la bibliothèque. |
Questions fréquemment posées
Q : Quelle est la version minimale de Java requise ?
R : Java 8 ou supérieur est recommandé pour une compatibilité complète.
Q : Comment gérer efficacement des ensembles de documents très volumineux ?
R : Utilisez le traitement par lots, exécutez l’indexation dans des threads d’arrière‑plan et ajustez les paramètres de mémoire JVM.
Q : GroupDocs.Search peut‑il être déployé dans un environnement cloud ?
R : Oui, mais assurez‑vous que l’emplacement de stockage du dossier d’index soit accessible à toutes les instances.
Q : Quels avantages offre la recherche par synonymes ?
R : Elle élargit les termes de requête avec des mots associés, améliorant le rappel sans sacrifier la précision.
Q : Où puis‑je trouver une documentation plus avancée ?
R : Consultez la référence API officielle à GroupDocs.Search API Reference.
Ressources
- Documentation : GroupDocs Search for Java
- Référence API : GroupDocs Search API
- Téléchargement : Latest Releases
- GitHub : GroupDocs.Search on GitHub
- Support gratuit : GroupDocs Forum
- Licence temporaire : Acquire a License
En suivant ces étapes, vous savez maintenant comment créer un index de documents, ajouter des documents à l’index, configurer le dossier d’index, et optimiser les performances de recherche avec GroupDocs.Search pour Java. Bon codage !
Dernière mise à jour : 2026-03-15
Testé avec : GroupDocs.Search 25.4 for Java
Auteur : GroupDocs