Tutoriels de traitement de texte Java pour GroupDocs.Merger
Si vous devez travailler avec du contenu en texte brut en Java, java text processing est la base de nombreux scénarios d’automatisation — de l’analyse de journaux à la migration massive de données. GroupDocs.Merger pour Java fournit une API puissante et indépendante du format qui vous permet de diviser, extraire et réorganiser le texte sans quitter la JVM. Dans ce guide, nous parcourrons les opérations les plus courantes, expliquerons pourquoi elles sont importantes et vous indiquerons les tutoriels prêts à l’emploi qui démontrent chaque technique en code.
Réponses rapides
- Que peut faire GroupDocs.Merger avec du texte ? Il peut diviser les fichiers par plages de lignes, extraire des lignes individuelles et créer des documents séparés pour chaque segment.
- Une bibliothèque supplémentaire est‑elle requise ? Non — uniquement le package NuGet/JAR GroupDocs.Merger pour Java.
- Puis‑je traiter des fichiers de plus de 100 Mo ? Oui, l’API diffuse les données, vous permettant de gérer des fichiers de plusieurs centaines de mégaoctets sans charger le fichier entier en mémoire.
- Ai‑je besoin d’une licence pour le développement ? Une licence temporaire gratuite est disponible pour les tests ; une licence commerciale est requise pour la production.
- Quelles versions de Java sont prises en charge ? Java 8 et versions ultérieures, y compris Java 11, 17 et 21.
Qu’est‑ce que le traitement de texte java ?
Java text processing désigne la manipulation de données en texte brut — lecture, division, filtrage et écriture — à l’aide des API Java. GroupDocs.Merger étend ce concept en traitant un fichier texte comme un objet document, permettant des opérations de haut niveau telles que la division par plages de lignes et la création de documents en lot.
Pourquoi utiliser GroupDocs.Merger pour le traitement de texte java ?
GroupDocs.Merger prend en charge 50+ formats d’entrée et de sortie (y compris TXT, CSV, DOCX, PDF et HTML) et peut traiter des fichiers d’une taille jusqu’à 500 Mo tout en maintenant la consommation de mémoire sous 50 Mo grâce à son architecture de streaming. Cette performance quantifiée le rend idéal pour les pipelines d’entreprise qui nécessitent une gestion fiable et à haut débit du texte.
Prérequis
- Java 8 ou version supérieure installé sur votre machine de développement.
- Dépendance Maven ou Gradle pour
com.groupdocs:groupdocs-mergerajoutée à votre projet. - Un fichier de licence GroupDocs temporaire ou commercial valide (vous pouvez en obtenir un via le lien « Temporary License » ci‑dessous).
Comment diviser un fichier texte en documents séparés par ligne à l’aide de GroupDocs.Merger pour Java ?
Merger est la classe principale de GroupDocs.Merger qui charge et manipule les documents.split est une méthode qui divise un document en parties séparées en fonction des plages de lignes fournies.
Chargez le fichier source avec Merger et invoquez split, en fournissant les numéros de ligne de début et de fin pour chaque segment. L’API renvoie une liste d’objets Document que vous pouvez enregistrer individuellement, en gérant n’importe quelle taille de fichier tout en préservant l’ordre des lignes.
Étape 1 : Initialiser le Merger avec votre licence
Créez une instance Merger, pointez‑la vers le fichier de licence et chargez le fichier texte cible.
Étape 2 : Définir les plages de lignes et diviser
Fournissez un tableau d’objets LineRange — chacun décrivant une paire de ligne de début et de fin. LineRange est une classe d’aide qui représente une plage de numéros de ligne à extraire. La bibliothèque générera des documents séparés pour chaque plage.
Étape 3 : Enregistrer les documents résultants
Itérez sur la liste renvoyée et appelez save sur chaque Document, en spécifiant le format de sortie souhaité tel que TXT ou PDF.
Conseil : Lors de la division de journaux très volumineux, utilisez des objets
LineRangecouvrant des blocs de 10 000 lignes afin de garder chaque fichier de sortie gérable et d’améliorer la vitesse de traitement en aval.
Comment diviser le texte par des délimiteurs personnalisés ? (how to split text)
splitByDelimiter est une méthode qui divise un document chaque fois qu’un délimiteur de chaîne spécifié apparaît.
Fournissez la chaîne de délimiteur à splitByDelimiter, par exemple splitByDelimiter("###"), et l’API traitera chaque occurrence comme un point de division, générant des documents séparés. Le délimiteur peut être n’importe quelle séquence Unicode, et vous pouvez également spécifier le format de sortie souhaité pour chaque partie, assurant une encodage et une dénomination cohérents.
Comment séparer les lignes en documents individuels ? (how to separate lines)
splitByLine est une méthode qui crée un document séparé pour chaque ligne du texte source.
Lorsque vous appelez splitByLine(), la bibliothèque parcourt le fichier ligne par ligne, renvoyant une collection où chaque élément représente une ligne unique. Vous pouvez alors enregistrer chaque élément directement en TXT, PDF ou tout format supporté, en appliquant éventuellement des modèles de nommage personnalisés pour garder la sortie organisée.
Pièges courants et solutions
- Lignes vides au début ou à la fin d’une plage : Coupez la plage ou utilisez le drapeau
ignoreEmptyLinespour éviter de générer des documents vides. - Incohérences d’encodage : Définissez explicitement l’encodage du fichier source (par ex., UTF‑8) lors de la construction du
Mergerpour éviter les caractères illisibles. - Pics de mémoire sur de très gros fichiers : Assurez‑vous de diffuser le fichier source en passant un
InputStreamau lieu d’un objetFile; cela maintient une faible utilisation du tas.
Tutoriels disponibles
Comment diviser un fichier texte en documents séparés par ligne à l’aide de GroupDocs.Merger pour Java
Apprenez à utiliser GroupDocs.Merger pour Java afin de diviser efficacement de gros fichiers texte par lignes, améliorant la gestion des données et le traitement dans vos applications.
Ressources supplémentaires
- Documentation GroupDocs.Merger pour Java
- Référence API GroupDocs.Merger pour Java
- Télécharger GroupDocs.Merger pour Java
- Forum GroupDocs.Merger
- Support gratuit
- Licence temporaire
Questions fréquemment posées
Q : Puis‑je diviser un PDF et un fichier TXT avec le même code ?
A : Oui, l’API Merger abstrait le format, ainsi la même méthode split fonctionne pour PDF, TXT, DOCX et autres types pris en charge.
Q : Comment GroupDocs.Merger gère‑t‑il les très gros fichiers ?
A : Il diffuse les données, maintenant l’utilisation de la mémoire sous 50 Mo même pour des fichiers de plus de 500 Mo, ce qui élimine les erreurs de dépassement de mémoire.
Q : Est‑il possible de diviser les fichiers en fonction d’une expression régulière ?
A : Bien que l’API n’accepte pas directement les regex, vous pouvez pré‑traiter le texte en utilisant la classe Pattern de Java, puis fournir les plages de lignes calculées au Merger.
Q : Dois‑je installer des bibliothèques natives supplémentaires ?
A : Non, la bibliothèque est purement Java et fonctionne sur toute plateforme supportant la version Java requise.
Q : Quelles options de licence sont disponibles pour une utilisation en production ?
A : GroupDocs propose des licences perpétuelles, d’abonnement et temporaires ; la licence temporaire est idéale pour l’évaluation et les tests.
Dernière mise à jour : 2026-07-20
Testé avec : GroupDocs.Merger 23.12 for Java
Auteur : GroupDocs