Wie man Excel mit GroupDocs.Parser für Java analysiert – Anleitung

In heutigen daten‑zentrierten Anwendungen kann wie man Excel analysiert Dateien effizient den Unterschied zwischen Erfolg und Misserfolg eines Workflows ausmachen. Egal, ob Sie Legacy‑Daten migrieren, automatisierte Berichte erstellen oder Rohtext in Analyse‑Pipelines einspeisen – das Extrahieren von unformatiertem Text aus jedem Arbeitsblatt ist eine häufige Anforderung. Dieses Tutorial führt Sie durch die Verwendung von GroupDocs.Parser für Java, um Excel‑Dateien zu analysieren, den Text von Excel‑Blättern zu lesen und Rohinhalt mit minimalem Code abzurufen.

Schnellantworten

  • Welche Bibliothek verarbeitet Excel‑Parsing in Java? GroupDocs.Parser für Java.
  • Kann ich Rohtext aus jedem Blatt extrahieren? Ja, mit TextReader bei aktivierter Rohmodus‑Option.
  • Benötige ich eine Lizenz? Eine temporäre kostenlose Lizenz steht für Evaluierungszwecke zur Verfügung.
  • Welche Java‑Version ist erforderlich? JDK 8 oder höher.
  • Wird Maven unterstützt? Absolut – fügen Sie das Repository und die Abhängigkeit zu pom.xml hinzu.

Was bedeutet „wie man Excel mit GroupDocs.Parser analysiert“?

Excel mit GroupDocs.Parser zu analysieren bedeutet, programmgesteuert eine .xlsx‑ (oder andere unterstützte) Arbeitsmappe zu öffnen, durch ihre Blätter zu iterieren und den Klartext ohne Formatierung zu lesen. Dieser Ansatz ist schneller als das Laden der gesamten Arbeitsmappe in eine schwere Tabellen‑API und gibt Ihnen direkten Zugriff auf die zugrunde liegenden Zeichen.

Warum GroupDocs.Parser für Java verwenden?

  • Geschwindigkeit & geringer Speicherverbrauch: Verarbeitet ein Blatt nach dem anderen.
  • Breite Formatunterstützung: Unterstützt XLSX, XLS, CSV und mehr.
  • Einfache API: Nur wenige Code‑Zeilen, um Text zu extrahieren.
  • Enterprise‑taugliche Lizenzierung: Kostenlose Testversion, anschließend skalierbare kommerzielle Optionen.

Voraussetzungen

  • Java Development Kit (JDK): 8 oder neuer.
  • IDE: IntelliJ IDEA, Eclipse oder ein beliebiger Java‑kompatibler Editor.
  • Maven (optional): Für einfache Abhängigkeitsverwaltung.

GroupDocs.Parser für Java einrichten

Maven‑Setup

Wenn Sie Abhängigkeiten mit Maven verwalten, fügen Sie das Repository und die Abhängigkeit zu Ihrer pom.xml hinzu:

<repositories>
   <repository>
      <id>repository.groupdocs.com</id>
      <name>GroupDocs Repository</name>
      <url>https://releases.groupdocs.com/parser/java/</url>
   </repository>
</repositories>

<dependencies>
   <dependency>
      <groupId>com.groupdocs</groupId>
      <artifactId>groupdocs-parser</artifactId>
      <version>25.5</version>
   </dependency>
</dependencies>

Direkter Download

Alternativ können Sie die neueste Version von GroupDocs.Parser für Java direkt von GroupDocs releases herunterladen.

Lizenzbeschaffung

Um mit einer kostenlosen Testversion zu starten, besuchen Sie die GroupDocs‑Website, um eine temporäre Lizenz zu erhalten. Diese ermöglicht Ihnen, die vollen Funktionen der Bibliothek vor dem Kauf einer Produktionslizenz zu evaluieren.

Grundlegende Initialisierung und Setup

Sobald die Bibliothek im Klassenpfad ist, können Sie eine Parser‑Instanz erstellen, die auf Ihre Excel‑Arbeitsmappe zeigt:

import com.groupdocs.parser.Parser;
import com.groupdocs.parser.data.TextReader;
import com.groupdocs.parser.options.IDocumentInfo;
import com.groupdocs.parser.options.TextOptions;

String excelFilePath = "YOUR_DOCUMENT_DIRECTORY/sample.xlsx";

try (Parser parser = new Parser(excelFilePath)) {
    // Your code to work with the document
} catch (Exception e) {
    e.printStackTrace();
}

Mit der vorbereiteten Umgebung können wir nun in die eigentliche Extraktionslogik eintauchen.

Wie man Excel analysiert: Rohtext aus Blättern extrahieren

Schritt 1 – Dokumentinformationen abrufen

Zuerst holen Sie Metadaten zur Arbeitsmappe, z. B. die Anzahl der Arbeitsblätter (Rohseiten).

IDocumentInfo spreadsheetInfo = parser.getDocumentInfo();

Schritt 2 – Durch jedes Blatt iterieren und Text lesen

Iterieren Sie über jedes Blatt und ziehen Sie den rohen, unformatierten Text. Der Parameter TextOptions(true) aktiviert den Rohmodus.

for (int p = 0; p < spreadsheetInfo.getRawPageCount(); p++) {
    try (TextReader reader = parser.getText(p, new TextOptions(true))) {
        String sheetContent = reader.readToEnd();
        
        // Process or use extracted text data here
    }
}

Verarbeiteter extrahierter Daten

An diesem Punkt enthält sheetContent den Klartext des aktuellen Arbeitsblatts. Sie können:

  • Es in einer .txt‑Datei zur Archivierung speichern.
  • In eine Natural‑Language‑Processing‑Pipeline einspeisen.
  • In einer Datenbank für spätere Abfragen ablegen.

Häufige Probleme und Lösungen

ProblemWarum es passiertLösung
Datei nicht gefundenFalscher excelFilePath.Pfad überprüfen und sicherstellen, dass die Datei lesbar ist.
Nicht unterstütztes FormatÄltere XLS‑Datei mit neuerer Parser‑Version verwendet.Datei in XLSX konvertieren oder auf die neueste GroupDocs.Parser‑Version aktualisieren.
Out‑of‑Memory‑Fehler bei großen ArbeitsmappenAlle Blätter gleichzeitig geladen.Ein Blatt nach dem anderen verarbeiten (wie gezeigt) und Ressourcen zeitnah freigeben.
Lizenz‑AusnahmeTestlizenz abgelaufen oder Lizenzdatei fehlt.Vor dem Parsen eine gültige temporäre oder gekaufte Lizenz anwenden.

Praktische Anwendungsfälle (Excel‑Blatt‑Text lesen)

  1. Datenmigration: Legacy‑Tabellendaten in moderne Datenbanken übertragen, ohne manuelles Kopieren‑Einfügen.
  2. Automatisierte Berichterstellung: Rohwerte aus mehreren Arbeitsmappen ziehen, um konsolidierte PDF‑ oder HTML‑Berichte zu erzeugen.
  3. Suchindizierung: Extrahierten Text in Elasticsearch indexieren für schnelle Inhaltsfindung.

Performance‑Tipps für große Excel‑Dateien

  • Stream pro Blatt: Die Schleife verarbeitet bereits ein Blatt nach dem anderen, wodurch der Speicherverbrauch gering bleibt.
  • TextReader‑Objekte wiederverwenden: Vermeiden Sie das Erzeugen unnötiger Objekte innerhalb enger Schleifen.
  • Parallele Verarbeitung: Bei extrem großen Arbeitsmappen können Sie Blätter in separaten Threads verarbeiten, achten Sie jedoch auf Thread‑Sicherheit der Parser‑Instanz.

Häufig gestellte Fragen

F: Welche anderen Tabellen‑Formate unterstützt GroupDocs.Parser?
A: Es verarbeitet XLSX, XLS, CSV und weitere Office‑Open‑XML‑Formate.

F: Kann ich auch Zellformatierungsinformationen extrahieren?
A: Ja, indem Sie TextOptions ohne den Roh‑Flag verwenden, erhalten Sie formatierten Text.

F: Wie gehe ich mit passwortgeschützten Excel‑Dateien um?
A: Das Passwort an den Parser‑Konstruktor übergeben: new Parser(filePath, "password").

F: Gibt es eine Möglichkeit, nur bestimmte Spalten zu extrahieren?
A: Sie können sheetContent nachträglich filtern oder die SpreadsheetOptions‑API für feinere Kontrolle nutzen.

F: Wo finde ich weitere Code‑Beispiele?
A: Schauen Sie in die GroupDocs‑Dokumentation und das GitHub‑Repository für zusätzliche Samples.

Ressourcen


Zuletzt aktualisiert: 2026-02-14
Getestet mit: GroupDocs.Parser 25.5 für Java
Autor: GroupDocs