DOCX szöveg kinyerése a GroupDocs.Viewer for Java segítségével

Programozottan szeretne extract text from docx fájlokból szöveget kinyerni? Akár oldalszámokat kell kinyernie, minden szövegsort rögzíteni, vagy kereshető indexeket építeni, a manuális megközelítés időigényes és hibára hajlamos. GroupDocs.Viewer for Java egyszerűsíti a folyamatot, magas teljesítményű API-kat biztosítva, amelyek beolvassák a dokumentum szerkezetét és tiszta szöveges adatot adnak vissza.

Ebben az útmutatóban megtanulja, hogyan állítsa be a GroupDocs.Viewer‑t, hogyan nyerje ki az oldalmétaadatokat, és hogyan vonja ki a DOCX fájl minden szövegsorát. A végére egy kész megoldást kap, amelyet bármely Java‑alapú háttérrendszerbe integrálhat.

Dokumentumelemzés a GroupDocs.Viewer for Java segítségével

Gyors válaszok

  • Mi a “extract text from docx” jelentése? Azt jelenti, hogy programozottan olvas egy DOCX fájlt, és soronként visszanyeri a tiszta szöveges tartalmat.
  • Melyik könyvtár kezeli ezt? A GroupDocs.Viewer for Java biztosítja a Viewer osztályt és a kapcsolódó API‑kat.
  • Szükségem van licencre? Egy ingyenes próba a kiértékeléshez működik; a termeléshez fizetett licenc szükséges.
  • Milyen Java verzió szükséges? Bármely JDK 8 + verzió, amely kompatibilis a Maven‑nel.
  • Feldolgozhatok nagy kötegelt fájlokat? Igen – a Viewer példányok újrafelhasználásával és az oldalak stream‑ben történő kezelésével.

Mi a “extract text from docx”?

A DOCX fájlból történő szövegkivonás azt jelenti, hogy a dokumentum belső XML struktúráját olvassa, és a formázás nélküli ember által olvasható szöveget adja vissza. Ez hasznos indexeléshez, kereséshez, vagy a tartalom downstream analitikai csővezetékekbe való továbbításához.

Miért használja a GroupDocs.Viewer for Java‑t?

  • Pontosság: Kezeli a komplex elrendezéseket, táblázatokat és többoszlopos dokumentumokat.
  • Sebesség: Optimalizált renderelő motor, amely nagy fájlok esetén is gyorsan működik.
  • Keresztformátumú támogatás: Ugyanaz az API működik PDF, PPTX, XLSX és további formátumok esetén, így újrahasználhatja a kódot.
  • Nincsenek külső függőségek: Tiszta Java, nincs szükség natív könyvtárakra.

Előkövetelmények

  • Java Development Kit (JDK) 8 vagy újabb.
  • Maven telepítve a függőségkezeléshez.
  • Egy DOCX fájl, amelyet elemezni szeretne (helyezze egy ismert mappába).

A GroupDocs.Viewer for Java beállítása

Adja hozzá a GroupDocs tárolót és a függőséget a pom.xml fájlhoz:

<repositories>
   <repository>
      <id>repository.groupdocs.com</id>
      <name>GroupDocs Repository</name>
      <url>https://releases.groupdocs.com/viewer/java/</url>
   </repository>
</repositories>

<dependencies>
   <dependency>
      <groupId>com.groupdocs</groupId>
      <artifactId>groupdocs-viewer</artifactId>
      <version>25.2</version>
   </dependency>
</dependencies>

Licenc beszerzési lépések

Alapvető inicializálás

  1. Importálja a szükséges osztályokat.
  2. Hozzon létre egy Viewer példányt, amely az Ön DOCX fájljára mutat.
  3. ViewInfoOptions.forPngView(true) használatával kérjen oldal‑szintű információkat (metaadatok és szövegsorok).

Hogyan nyerjünk ki szöveget a docx‑ből – Lépésről‑lépésre útmutató

1. Oldal metaadatok kinyerése

Az oldal metaadatai, például az oldalszám, elengedhetetlen, ha navigációs struktúrákat kell építeni vagy konkrét szakaszokra hivatkozni.

try (Viewer viewer = new Viewer("YOUR_DOCUMENT_DIRECTORY/SAMPLE_DOCX")) {
    ViewInfoOptions viewInfoOptions = ViewInfoOptions.forPngView(true);
    ViewInfo viewInfo = viewer.getViewInfo(viewInfoOptions);
    for (Page page : viewInfo.getPages()) {
        int pageNumber = page.getNumber();
        System.out.println("Page: " + pageNumber); // Outputs the page number
    }
}
  • ViewInfoOptions.forPngView(true): Az API‑t arra utasítja, hogy gyűjtse az oldal információkat a PNG renderelés előkészítése közben.
  • viewInfo.getPages(): Egy gyűjteményt ad vissza, ahol minden Page objektum tartalmazza a számát és egyéb metaadatait.

Pro tip: A Viewer-t egy try‑with‑resources blokkban szabadítsa fel, hogy a natív erőforrások automatikusan felszabaduljanak.

2. Szövegsorok kinyerése az oldalakról

Miután már azonosítani tudja az egyes oldalakat, vonjuk ki a tényleges szövegsorokat.

try (Viewer viewer = new Viewer("YOUR_DOCUMENT_DIRECTORY/SAMPLE_DOCX")) {
    ViewInfoOptions viewInfoOptions = ViewInfoOptions.forPngView(true);
    ViewInfo viewInfo = viewer.getViewInfo(viewInfoOptions);
    for (Page page : viewInfo.getPages()) {
        System.out.println("Page: " + page.getNumber());
        System.out.println("Text lines:");
        
        for (Line line : page.getLines()) {
            String lineText = line.getValue();
            System.out.print(lineText + "\t");
        }
    }
}
  • page.getLines(): Egy Line objektumok listáját adja vissza, ahol minden egyes objektum egyetlen szövegsort képvisel, ahogy az az oldalon megjelenik.
  • A belső ciklus kiírja minden sort, tabulátorokkal elválasztva a jobb olvashatóság érdekében.

Gyakori problémák és megoldások

TünetValószínű okMegoldás
null page numbersA dokumentum nem lett megfelelően betöltveEllenőrizze a fájl útvonalát, és győződjön meg róla, hogy a fájl létezik.
No text lines returnedNem támogatott fájlformátumEllenőrizze, hogy a DOCX verzió támogatott-e; szükség esetén frissítse a GroupDocs‑t.
OutOfMemoryError on large filesA Viewer túl sok oldalt tart a memóriábanDolgoztassa fel az oldalakat kisebb kötegekben, vagy használja újra ugyanazt a Viewer példányt.

Gyakorlati alkalmazások

  1. Search Engine Indexing: Tárolja az oldalszámokat a kinyert szöveg mellett, hogy pontos részletlekérdezést tegyen lehetővé.
  2. Legal Document Review: Vonjon ki minden sort az automatikus záradék-észleléshez vagy a redakciós munkafolyamatokhoz.
  3. Content Migration: Hozza át a régi DOCX tartalmat egy CMS‑be, miközben megőrzi a struktúrát.
  4. Reporting Dashboards: Összegyezze a kulcsfontosságú szakaszokat a címsorok és felsorolások kinyerésével.

Teljesítmény szempontok

  • Dispose Properly: Mindig zárja be a Viewer‑t (használjon try‑with‑resources blokkot).
  • Batch Processing: Sok dokumentum kezelésekor használja újra egyetlen Viewer példányt szálanként a terhelés csökkentése érdekében.
  • Render Options: Ha csak szövegre van szüksége, kihagyhatja a PNG renderelést a ViewInfoOptions.forTextView() használatával (itt nem látható), így csökkentve a feldolgozási időt.

Következtetés

Most már tudja, hogyan extract text from docx fájlokból nyerhet szöveget a GroupDocs.Viewer for Java segítségével, hogyan szerezheti meg az oldalszámokat, és hogyan iterálhat minden szövegsoron. Ezek az építőelemek lehetővé teszik, hogy gyors, megbízható és könnyen karbantartható dokumentum‑feldolgozó csővezetékeket hozzon létre.

Következő lépések

  • Kísérletezzen más formátumokkal (PDF, PPTX) ugyanazzal az API‑val.
  • Kombinálja a kinyert szöveget egy teljes szöveges keresőmotorral, például az Elasticsearch‑szel.
  • Fedezze fel a renderelt képek stílusbeállításait, ha vizuális előnézetekre is szüksége van.

Gyakran Ismételt Kérdések

Q: Milyen fájlformátumokat támogat a GroupDocs.Viewer?
A: Széles körű formátumokat támogat, beleértve a DOCX, PDF, XLSX, PPTX és még sok más.

Q: Testreszabhatom a kimeneti formátumot a sorok kinyerésekor?
A: Igen, a ViewInfoOptions konfigurálásával (például forTextView() a tiszta szöveghez).

Q: Van korlát a feldolgozható oldalak számában?
A: Nincs szigorú korlát, de nagyon nagy dokumentumok esetén a memóriahatékonyság érdekében kötegelt feldolgozásra lehet szükség.

Q: Hogyan kezeljem a kivételeket a GroupDocs.Viewer‑ben?
A: A Viewer kódját try‑catch blokkokba helyezze, és kezelje a ViewerException‑t vagy általános IOException‑t a szükség szerint.

Q: Integrálható ez az eszköz más Java keretrendszerekkel?
A: Természetesen! Zökkenőmentesen működik a Spring, Hibernate, Jakarta EE és más keretrendszerekkel.

Források


Utoljára frissítve: 2026-04-13
Tesztelve ezzel: GroupDocs.Viewer for Java 25.2
Szerző: GroupDocs