GroupDocs.Viewer for Java का उपयोग करके PDF टेक्स्ट निकालने का तरीका
PDF से टेक्स्ट निकालना कई डेटा‑ड्रिवेन एप्लिकेशनों के लिए एक मुख्य आवश्यकता है। इस ट्यूटोरियल में हम आपको how to extract pdf सामग्री को प्रभावी ढंग से GroupDocs Viewer Java लाइब्रेरी के साथ निकालने का तरीका दिखाएंगे। चाहे आपको दस्तावेज़ों को इंडेक्स करना हो, एनालिटिक्स चलाना हो, या लेगेसी आर्काइव्स को माइग्रेट करना हो, नीचे दिए गए चरण एक पूर्ण, प्रोडक्शन‑रेडी समाधान प्रदान करते हैं।

त्वरित उत्तर
- pdf टेक्स्ट एक्सट्रैक्शन के लिए कौनसी लाइब्रेरी सबसे अच्छी है? GroupDocs.Viewer Java एक मजबूत pdf टेक्स्ट एक्सट्रैक्शन API प्रदान करता है।
- क्या मैं मल्टी‑पेज PDF से टेक्स्ट निकाल सकता हूँ? हाँ – व्यूअर स्वचालित रूप से प्रत्येक पेज और लाइन को इटररेट करता है।
- क्या प्रोडक्शन के लिए लाइसेंस चाहिए? एक वाणिज्यिक लाइसेंस आवश्यक है; मूल्यांकन के लिए एक फ्री ट्रायल उपलब्ध है।
- कौन सा Java संस्करण समर्थित है? JDK 1.8+ (नवीनतम LTS रिलीज़ भी काम करती हैं)।
- क्या डिपेंडेंसी जोड़ने का एकमात्र तरीका Maven है? Maven की सलाह दी जाती है, लेकिन आप Gradle या मैन्युअल JAR इंक्लूजन भी उपयोग कर सकते हैं।
PDF टेक्स्ट एक्सट्रैक्शन क्या है और GroupDocs Viewer का उपयोग क्यों करें?
pdf text extraction api PDF की टेक्स्टुअल लेयर को बिना विज़ुअल कंटेंट को रेंडर किए पढ़ता है। यह तरीका रास्टर‑आधारित OCR की तुलना में बहुत तेज़ है और मूल दस्तावेज़ संरचना को संरक्षित रखता है। GroupDocs Viewer Java जटिल लेआउट, एन्क्रिप्टेड फ़ाइलें, और मल्टी‑पेज दस्तावेज़ों को आउट‑ऑफ़‑द‑बॉक्स संभालकर अतिरिक्त मूल्य जोड़ता है।
पूर्वापेक्षाएँ
- Java Development Kit (JDK) 1.8+ स्थापित है।
- Maven डिपेंडेंसी मैनेजमेंट के लिए (या यदि आप चाहें तो Gradle)।
- GroupDocs Viewer for Java लाइसेंस तक पहुँच (फ्री ट्रायल या खरीदा हुआ)।
- बेसिक Java ज्ञान – आप कुछ
try‑with‑resourcesब्लॉक्स लिखेंगे।
GroupDocs.Viewer for Java सेटअप करना
अपने pom.xml में GroupDocs रिपॉजिटरी और डिपेंडेंसी जोड़ें:
<repositories>
<repository>
<id>repository.groupdocs.com</id>
<name>GroupDocs Repository</name>
<url>https://releases.groupdocs.com/viewer/java/</url>
</repository>
</repositories>
<dependencies>
<dependency>
<groupId>com.groupdocs</groupId>
<artifactId>groupdocs-viewer</artifactId>
<version>25.2</version>
</dependency>
</dependencies>
लाइसेंस प्राप्ति
- Free Trial – pdf टेक्स्ट एक्सट्रैक्शन api को एक्सप्लोर करने के लिए उत्तम।
- Temporary License – बिना क्रेडिट कार्ड के विस्तारित परीक्षण।
- Full Purchase – वाणिज्यिक डिप्लॉयमेंट के लिए आवश्यक।
कार्यान्वयन गाइड
नीचे GroupDocs Viewer Java के साथ PDF टेक्स्ट निकालने की संक्षिप्त, चरण‑दर‑चरण गाइड दी गई है।
1. Viewer ऑब्जेक्ट को इनिशियलाइज़ करें
try (Viewer viewer = new Viewer("YOUR_DOCUMENT_DIRECTORY/SAMPLE_PDF")) {
// Initialization complete, proceed to next steps.
}
Viewer इंस्टेंस उस PDF की ओर इशारा करता है जिसे आप प्रोसेस करना चाहते हैं। try‑with‑resources ब्लॉक का उपयोग करने से नेटिव रिसोर्सेज़ स्वचालित रूप से रिलीज़ हो जाते हैं।
2. टेक्स्ट एक्सट्रैक्शन के लिए ViewInfoOptions कॉन्फ़िगर करें
ViewInfoOptions viewInfoOptions = ViewInfoOptions.forHtmlView();
viewInfoOptions.setExtractText(true);
setExtractText(true) सेट करने से pdf टेक्स्ट एक्सट्रैक्शन api को व्यू जानकारी में रॉ टेक्स्ट शामिल करने के लिए कहा जाता है।
3. दस्तावेज़ जानकारी प्राप्त करें
PdfViewInfo viewInfo = (PdfViewInfo) viewer.getViewInfo(viewInfoOptions);
PdfViewInfo आपको प्रत्येक पेज, लाइन और उसके टेक्स्टुअल वैल्यू तक पहुँच देता है।
4. पेज और लाइनों के माध्यम से इटररेट करें (मल्टी‑पेज PDF टेक्स्ट निकालें)
for (Page page : viewInfo.getPages()) {
for (Line line : page.getLines()) {
System.out.println(line.getValue());
}
}
यह लूप हर टेक्स्ट लाइन को प्रिंट करता है, extract multi page pdf परिदृश्यों को स्वचालित रूप से संभालता है। आप System.out.println को फ़ाइल, डेटाबेस, या सर्च इंडेक्स में लिखने वाले कोड से बदल सकते हैं।
समस्या निवारण टिप्स
- फ़ाइल पाथ को दोबारा जांचें; गलत पाथ
FileNotFoundExceptionफेंकेगा। - सुनिश्चित करें कि
setExtractText(true)कॉल किया गया है; अन्यथा केवल विज़ुअल डेटा रिटर्न होगा। - एन्क्रिप्टेड PDF के लिए, पासवर्ड
Viewerकन्स्ट्रक्टर ओवरलोड के माध्यम से पास करें।
व्यावहारिक अनुप्रयोग
GroupDocs Viewer की extract pdf text java क्षमताएँ कई वास्तविक उपयोग मामलों को खोलती हैं:
- Data Migration – लेगेसी PDF आर्काइव्स को सर्चेबल डेटाबेस में माइग्रेट करें।
- Content Analysis – निकाले गए टेक्स्ट को NLP पाइपलाइन में फीड करें सेंटिमेंट या कीवर्ड एक्सट्रैक्शन के लिए।
- Document Management Systems (DMS) – तेज़ रिट्रीवल के लिए दस्तावेज़ों को ऑटो‑इंडेक्स करें।
प्रदर्शन संबंधी विचार
जब बड़े फ़ाइलों या बैच जॉब्स के साथ काम कर रहे हों:
- Memory Management – पेजेज़ को
tryब्लॉक के अंदर प्रोसेस करें ताकि गार्बेज कलेक्टर तुरंत मेमोरी रीक्लेम कर सके। - Streaming – अत्यधिक बड़े PDF के लिए, पूरे दस्तावेज़ को लोड करने के बजाय एक समय में एक पेज प्रोसेस करने पर विचार करें।
- Threading – कई फ़ाइलों में एक्सट्रैक्शन को पैरललाइज़ करें, लेकिन प्रत्येक थ्रेड में एक ही
Viewerइंस्टेंस रखें।
सामान्य समस्याएँ और समाधान
| समस्या | समाधान |
|---|---|
OutOfMemoryError बड़े PDFs पर | JVM हीप (-Xmx2g) बढ़ाएँ और पेजेज़ को क्रमिक रूप से प्रोसेस करें। |
| स्कैन किए गए PDFs के लिए कोई टेक्स्ट रिटर्न नहीं हुआ | OCR ऐड‑ऑन या समर्पित OCR लाइब्रेरी का उपयोग करें; GroupDocs Viewer केवल एम्बेडेड टेक्स्ट निकालता है। |
| प्रोडक्शन में लाइसेंस त्रुटि | सुनिश्चित करें कि लाइसेंस फ़ाइल सही जगह पर रखी गई है और ट्रायल अवधि समाप्त नहीं हुई है। |
अक्सर पूछे जाने वाले प्रश्न
Q: क्या मैं प्रोडक्शन सर्वर पर GroupDocs.Viewer का उपयोग कर सकता हूँ?
A: हाँ, लेकिन आपके पास एक वैध वाणिज्यिक लाइसेंस होना चाहिए। फ्री ट्रायल विकास और परीक्षण तक सीमित है।
Q: टेक्स्ट एक्सट्रैक्शन PDF मेटाडेटा को कैसे प्रभावित करता है?
A: एक्सट्रैक्शन केवल सामग्री पढ़ता है; मेटाडेटा अपरिवर्तित रहता है जब तक आप इसे स्पष्ट रूप से संशोधित न करें।
Q: PDF के अलावा GroupDocs Viewer कौन से अन्य फ़ाइल फ़ॉर्मेट सपोर्ट करता है?
A: यह Word, Excel, PowerPoint, इमेजेज़ और कई अन्य फ़ॉर्मेट को संभालता है, जिससे यह एक बहुमुखी दस्तावेज़ व्यूअर बनता है।
Q: क्या पासवर्ड‑प्रोटेक्टेड PDFs से टेक्स्ट निकालने का कोई तरीका है?
A: बिल्कुल – Viewer इंस्टेंस बनाते समय पासवर्ड पास करें।
Q: हज़ारों PDFs की बैच प्रोसेसिंग के प्रदर्शन को कैसे सुधारें?
A: थ्रेड पूल का उपयोग करें, प्रत्येक फ़ाइल को अपने Viewer इंस्टेंस में प्रोसेस करें, और मेमोरी उपयोग को बारीकी से मॉनिटर करें।
संसाधन
अंतिम अद्यतन: 2026-05-06
परीक्षण किया गया: GroupDocs.Viewer Java 25.2
लेखक: GroupDocs