Obtenir le contenu HTML C# – Extraire le HTML d’un document modifiable

Introduction

Si vous devez get HTML content C# depuis un fichier Word, DOCX ou tout autre fichier modifiable, GroupDocs.Editor for .NET le rend très simple. Dans ce tutoriel, nous parcourrons les étapes exactes pour extraire le HTML d’un document modifiable, vous montrer comment convert Word to HTML, et expliquer pourquoi cette approche est idéale lorsque vous devez edit Word document .NET. À la fin, vous serez prêt à intégrer l’extraction HTML dans vos propres projets en quelques lignes de code.

Réponses rapides

  • Que signifie « get HTML content C# » ? C’est le processus de récupération de la représentation HTML d’un document à l’aide de code C#.
  • Quelle bibliothèque gère la conversion ? GroupDocs.Editor for .NET fournit un support intégré pour Word, DOCX et d’autres formats.
  • Ai‑je besoin d’une licence pour la production ? Oui – une licence commerciale est requise pour une utilisation en production, mais un essai gratuit est disponible.
  • Puis‑je extraire uniquement une partie du document ? Vous pouvez récupérer la chaîne HTML complète puis découper ou analyser la partie dont vous avez besoin.
  • Cette approche est‑elle compatible .NET ? Absolument – elle fonctionne avec .NET Framework, .NET Core et .NET 5/6.

Qu’est-ce que « get HTML content C# » ?

Obtenir le contenu HTML C# désigne l’utilisation de code C# pour lire un document (par ex., .docx) et produire son contenu sous forme de chaîne HTML. Cela est utile pour l’aperçu web, la migration de contenu ou une manipulation supplémentaire du HTML.

Pourquoi extraire le HTML d’un document modifiable ?

  • Aperçu multiplateforme – afficher les fichiers Office dans les navigateurs sans nécessiter d’installation d’Office.
  • Réutilisation du contenu – réutiliser le texte et le style dans les pages web ou les modèles d’e‑mail.
  • Édition simplifiée – modifier le HTML, puis renvoyer les modifications au format original si nécessaire.
  • Intégration – combiner avec d’autres services .NET (par ex., conversion PDF, indexation de recherche).

Prérequis

  • Visual Studio (ou tout IDE .NET compatible)
  • .NET Framework ou runtime .NET Core installé
  • Bibliothèque GroupDocs.Editor for .NET ajoutée à votre projet (via NuGet)
  • Un document d’exemple (Word, DOCX, etc.) pour extraire le HTML
  • Connaissances de base en C#

Importer les espaces de noms

Pour commencer, importez les espaces de noms nécessaires qui exposent les classes GroupDocs.Editor.

using System;
using System.IO;
using GroupDocs.Editor.Options;

Comment obtenir le contenu HTML C# à partir d’un document modifiable

Voici le guide étape par étape qui montre how to extract HTML, qui est essentiellement identique à how to extract html depuis un document. Le même flux démontre également convert docx to html et convert word to html.

Étape 1 : Créer un FileStream pour votre document

Ouvrez le fichier source avec un FileStream. Ce flux alimente l’éditeur avec les octets du document.

using (FileStream fs = File.OpenRead("Your Sample Document"))
{
    // Next steps will be placed here
}

Étape 2 : Initialiser l’éditeur

À l’intérieur du bloc using, instanciez la classe Editor. Le délégué fournit le flux, et les options de chargement indiquent à l’éditeur le format que vous traitez (WordProcessing dans ce cas).

using (Editor editor = new Editor(delegate { return fs; }, delegate { return new WordProcessingLoadOptions(); }))
{
    // Next steps will be placed here
}

Étape 3 : Modifier le document

Créez un EditableDocument en utilisant la méthode Edit. Cet objet représente le document dans un état modifiable et vous donne accès à son contenu HTML.

using (EditableDocument document = editor.Edit(new WordProcessingEditOptions()))
{
    // Next steps will be placed here
}

Étape 4 : Extraire le contenu HTML

Enfin, appelez GetContent() sur le EditableDocument. La méthode renvoie l’ensemble du document sous forme de chaîne HTML. Pour la démonstration, nous affichons les 200 premiers caractères.

string htmlContent = document.GetContent();
Console.WriteLine("HTML content of the input document (first 200 chars): {0}", htmlContent.Substring(0, 200));

Problèmes courants et solutions

ProblèmeRaisonSolution
Sortie HTML videOptions de chargement incorrectes ou type de fichier non pris en chargeVérifiez que vous utilisez les WordProcessingLoadOptions corrects ou les options de chargement appropriées pour les PDF, les feuilles de calcul, etc.
Problèmes d’encodageLe document contient des caractères non‑ASCIIAssurez‑vous que le fichier source est enregistré avec l’encodage UTF‑8 ; GroupDocs.Editor gère Unicode automatiquement.
Ralentissement des performances sur les gros fichiersLes gros documents consomment plus de mémoireTraitez le document par morceaux ou augmentez la limite de mémoire de l’application.

Questions fréquentes

Quels types de documents GroupDocs.Editor for .NET peut‑il gérer ?

GroupDocs.Editor for .NET prend en charge un large éventail de formats de documents, y compris WordProcessing, Spreadsheet, Presentation, et plus encore.

Existe‑t‑il un essai gratuit pour GroupDocs.Editor for .NET ?

Oui, vous pouvez télécharger un essai gratuit depuis le site web.

Comment obtenir une licence temporaire pour GroupDocs.Editor for .NET ?

Vous pouvez demander une licence temporaire depuis la page d’achat GroupDocs.

Où trouver la documentation de GroupDocs.Editor for .NET ?

La documentation complète est disponible ici.

Puis‑je obtenir du support en cas de problème ?

Oui, vous pouvez obtenir du support sur le forum de support GroupDocs.


Dernière mise à jour : 2026-03-28
Testé avec : GroupDocs.Editor for .NET 23.12 (latest at time of writing)
Auteur : GroupDocs