ดึงข้อความจาก PDF ใน Java ด้วย GroupDocs.Parser OCR

ในสายการประมวลผลเอกสารสมัยใหม่ การ extract text from PDF java อย่างรวดเร็วและเชื่อถือได้เป็นสิ่งสำคัญ ไม่ว่าคุณจะต้องการแปลงสถาปัตยกรรมกระดาษเก่าเป็นดิจิทัลหรือสร้างบริการอ่านใบแจ้งหนี้ที่ต้อง read image text java จากโซนที่กำหนด เครื่องมือ OCR ของ GroupDocs.Parser จะมอบวิธีที่สะอาดและโปรแกรมได้เพื่อทำเช่นนั้น คู่มือนี้จะพาคุณผ่านการติดตั้งไลบรารี การกำหนดค่า OCR สำหรับสี่เหลี่ยมเฉพาะ และการจัดการข้อผิดพลาดเพื่อให้แอปพลิเคชันของคุณคงความเสถียร

คำตอบอย่างรวดเร็ว

  • What does “extract text from PDF” mean? มันแปลงเนื้อหาภาพของ PDF ที่สแกนเป็นข้อความที่สามารถค้นหาและแก้ไขได้.
  • Which Java library provides OCR? GroupDocs.Parser พร้อมคอนเนคเตอร์ Aspose OCR ที่รวมมาในตัว.
  • Is a license required for production? ใช่—ใช้การทดลองฟรีสำหรับการทดสอบ แล้วจึงขอรับใบอนุญาตแบบชำระเงินสำหรับการใช้งานจริง.
  • Can OCR be limited to a region? แน่นอน; ส่ง Rectangle ไปยัง OcrOptions เพื่อกำหนดเฉพาะพื้นที่ที่คุณต้องการ.
  • Do I need special error handling? ใช่—ห่อการเรียก OCR ด้วยบล็อก try‑catch เพื่อให้แอปคงที่แม้หน้าจะเสียหาย.

extract text from PDF java คืออะไร?

Extract text from PDF java คือกระบวนการนำ Optical Character Recognition (OCR) ไปใช้กับหน้าต่าง PDF ที่เป็นภาพ เพื่อให้ตัวอักษรกลายเป็นข้อความที่เครื่องคอมพิวเตอร์อ่านได้ ซึ่งทำให้สามารถค้นหาข้อความเต็ม, ทำดัชนี, และสกัดข้อมูลต่อเนื่องในแอปพลิเคชัน Java ได้, ให้ผู้พัฒนาสามารถวิเคราะห์และจัดการเนื้อหาเอกสารโดยอัตโนมัติ

ทำไมต้องใช้ GroupDocs.Parser สำหรับ OCR ใน Java?

GroupDocs.Parser รองรับ 50+ input and output formats และสามารถประมวลผล PDF หลายร้อยหน้าโดยไม่ต้องโหลดไฟล์ทั้งหมดเข้าสู่หน่วยความจำ, ให้ความเร็วเพิ่มขึ้นถึง 40 % เมื่อคุณจำกัด OCR ให้กับสี่เหลี่ยม. การบูรณาการที่ราบรื่นกับเครื่องมือ Aspose OCR หมายความว่าคุณจะได้การจดจำที่แม่นยำสูงโดยไม่ต้องตั้งค่าเพิ่มเติม, โดยเฉพาะสำหรับภาษาละตินทั่วไป.

ข้อกำหนดเบื้องต้น

  • Java Development Kit 8 หรือใหม่กว่า.
  • ไลบรารี GroupDocs.Parser – ติดตั้งผ่าน Maven หรือดาวน์โหลดโดยตรง.
  • ความคุ้นเคยพื้นฐานกับ Java try‑with‑resources และการจัดการข้อยกเว้น.

การตั้งค่า GroupDocs.Parser สำหรับ Java

การติดตั้งด้วย Maven

เพิ่ม repository และ dependency ลงใน pom.xml ของคุณ:

<repositories>
   <repository>
      <id>repository.groupdocs.com</id>
      <name>GroupDocs Repository</name>
      <url>https://releases.groupdocs.com/parser/java/</url>
   </repository>
</repositories>

<dependencies>
   <dependency>
      <groupId>com.groupdocs</groupId>
      <artifactId>groupdocs-parser</artifactId>
      <version>25.5</version>
   </dependency>
</dependencies>

ดาวน์โหลดโดยตรง

หรือดาวน์โหลดเวอร์ชันล่าสุดจาก GroupDocs.Parser for Java releases.

การรับใบอนุญาต

เริ่มต้นด้วยการทดลองฟรีหรือขอใบอนุญาตชั่วคราวเพื่อเข้าถึงฟีเจอร์ทั้งหมด. สำหรับการใช้งานจริง, ซื้อใบอนุญาตถาวร.

การเริ่มต้นและตั้งค่าพื้นฐาน

หลังจากเพิ่มไลบรารีแล้ว, คุณพร้อมที่จะใช้ความสามารถ OCR ของมัน.

คู่มือการใช้งาน

วิธีดึงข้อความ PDF ที่สแกนด้วยสี่เหลี่ยมที่กำหนด

การกำหนดพื้นที่เฉพาะช่วยเพิ่มความเร็วและความแม่นยำ, โดยเฉพาะเมื่อคุณต้องการ read image text java จากพื้นที่ที่รู้จัก.

Direct answer: โหลด PDF ด้วย Parser โดยใช้การตั้งค่า OCR‑enabled, กำหนด Rectangle ที่ครอบคลุมข้อความที่ต้องการ, แล้วเรียก extractText – การดำเนินการทั้งหมดเสร็จในสองถึงสามบรรทัดของโค้ดและคืนสตริงที่จดจำได้.

ขั้นตอนที่ 1: กำหนดค่า OCR

ParserSettings คืออ็อบเจ็กต์การกำหนดค่ากลางที่บอก GroupDocs.Parser ว่าใช้เครื่องมือ OCR ใด.

ParserSettings settings = new ParserSettings(new AsposeOcrOnPremise());

ขั้นตอนที่ 2: เริ่มต้น parser

Parser คือจุดเริ่มต้นสำหรับการดำเนินการอ่านเอกสารทั้งหมด.

try (Parser parser = new Parser("YOUR_DOCUMENT_DIRECTORY", settings)) {
    // Proceed to define OCR area and extract text.
}

ขั้นตอนที่ 3: กำหนดพื้นที่สำหรับ OCR

Rectangle แสดงถึงพื้นที่สี่เหลี่ยมบนหน้า, กำหนดโดยตำแหน่งต้นกำเนิด X/Y และความกว้าง/ความสูงเป็นพิกเซล.

OcrOptions ocrOptions = new OcrOptions(new Rectangle(0, 0, 400, 200));

สี่เหลี่ยมนี้เริ่มที่มุมบนซ้าย (0,0) และมีความกว้าง 400 px สูง 200 px.

ขั้นตอนที่ 4: ตั้งค่าตัวเลือกข้อความ

OcrOptions ให้คุณเปิดใช้งาน OCR เฉพาะสำหรับสี่เหลี่ยมที่กำหนด, ปล่อยส่วนที่เหลือของหน้าให้ไม่ถูกกระทบ.

TextOptions options = new TextOptions(false, true, ocrOptions);

false ปิดการจำกัดตามภาษา, ในขณะที่ true เปิดใช้งานพื้นที่ OCR.

ขั้นตอนที่ 5: ดึงข้อความ

extractText คืนสตริงที่ผ่านการประมวลผล OCR สำหรับหน้าที่และพื้นที่ที่ระบุ.

try (TextReader reader = parser.getText(options)) {
    String resultText = reader == null ? "Text extraction isn't supported" : reader.readToEnd();
    // Use extracted text as needed.
}

ขั้นตอนที่ 6: การจัดการข้อผิดพลาดในการประมวลผล OCR

ห่อการดำเนินการทั้งหมดในบล็อก try‑catch เพื่อจับข้อผิดพลาดใด ๆ, เช่น รูปแบบภาพที่ไม่รองรับหรือความกดดันของหน่วยความจำ.

try {
    // Include main OCR processing logic here (refer to previous section).
} catch (Exception ex) {
    System.out.println("An error occurs: " + ex.getMessage());
}

สิ่งนี้ทำให้แอปพลิเคชันของคุณคงเสถียรแม้เครื่องมือ OCR จะเจอรูปแบบที่ไม่คาดคิด.

การประยุกต์ใช้งานจริง

  1. Invoice processing – ดึงฟิลด์สำคัญจากใบแจ้งหนี้ที่สแกนโดยอัตโนมัติ.
  2. Document digitization – แปลงเอกสารกระดาษเก่าเป็น PDF ที่สามารถค้นหาได้.
  3. Data‑entry automation – ขจัดการพิมพ์ด้วยมือโดยอ่าน image text java จากแบบฟอร์ม.

พิจารณาด้านประสิทธิภาพ

  • Resource usage – ตรวจสอบหน่วยความจำ, โดยเฉพาะกับ PDF ขนาดใหญ่; GroupDocs.Parser ประมวลผลหน้าแบบ lazy เพื่อรักษา heap ให้ต่ำ.
  • Java memory management – ใช้ try‑with‑resources (ตามที่แสดง) เพื่อปิดสตรีมอย่างรวดเร็ว.
  • Batch processing – ทำ OCR แบบขนานบนหลายเอกสารเมื่อเป็นไปได้; ไลบรารีนี้ปลอดภัยต่อเธรดสำหรับการดำเนินการอ่านอย่างเดียว.

ปัญหาทั่วไปและวิธีแก้

ปัญหาวิธีแก้
ข้อผิดพลาด Out‑of‑memory บนไฟล์ขนาดใหญ่ประมวลผลหน้าเป็นชุดย่อย; เพิ่ม heap ของ JVM (-Xmx2g) หากจำเป็น.
ความแม่นยำ OCR ต่ำเพิ่ม DPI ของภาพต้นทางเป็น 300 + หรือให้คำแนะนำภาษาใน ParserSettings.
รูปแบบไฟล์ไม่รองรับตรวจสอบว่าไฟล์เป็น PDF หรือรูปภาพที่รองรับ; แปลงรูปแบบที่ไม่รองรับเป็น PNG ก่อน.

คำถามที่พบบ่อย

Q: What is OCR in the context of Java development?
A: Optical Character Recognition (OCR) แปลงภาพของข้อความเป็นอักขระที่เข้ารหัสโดยเครื่อง, และ GroupDocs.Parser มี API ที่เป็นมิตรกับ Java เพื่อทำเช่นนี้โดยไม่ต้องพึ่งพาไลบรารีเนทีฟภายนอก.

Q: How do I define a rectangular area for OCR extraction?
A: สร้างอ็อบเจ็กต์ Rectangle ด้วยค่า X, Y, ความกว้าง, และความสูงที่ต้องการ, แล้วส่งไปยัง OcrOptions เมื่อเรียก extractText.

Q: What are common errors during OCR processing, and how can I handle them?
A: ข้อผิดพลาดรวมถึงรูปแบบที่ไม่รองรับหรือการตั้งค่าที่ผิดพลาด; ควรห่อการเรียก OCR ด้วยบล็อก try‑catch เสมอและบันทึกรายละเอียดของข้อยกเว้น.

Q: Can I use GroupDocs.Parser without a license?
A: มีการทดลองฟรีสำหรับการประเมิน, แต่ต้องใช้เวอร์ชันที่มีใบอนุญาตสำหรับการใช้งานจริง.

Q: How can I optimise OCR performance in Java applications?
A: จำกัด OCR ให้กับพื้นที่ที่จำเป็น, ใช้ ParserSettings ซ้ำระหว่างเอกสาร, และรัน OCR เป็นชุดขนานเมื่อประมวลผลไฟล์หลายไฟล์.

แหล่งข้อมูล


อัปเดตล่าสุด: 2026-09-02
ทดสอบกับ: GroupDocs.Parser 25.5
ผู้เขียน: GroupDocs

บทเรียนที่เกี่ยวข้อง