GroupDocs.Parser と Aspose OCR を使用した Java の OCR 警告の処理

テキスト抽出中にアプリケーションが生成する OCR 警告(Java) を処理する必要がある場合、ここが適切な場所です。このチュートリアルでは、GroupDocs.Parser for Java と Aspose の OCR コネクタを統合する手順を解説し、エンジンが生成するすべての警告を取得しながら、画像テキスト(Java) を確実に読み取れるようにします。すぐに使用でき、任意の Java プロジェクトに組み込める完全なステップバイステップのソリューションが得られます。

簡単な回答

  • Java で OCR 警告を管理するのに役立つライブラリは何ですか? GroupDocs.Parser combined with Aspose OCR.
  • ライセンスは必要ですか? 評価には無料トライアルで動作しますが、本番環境ではフルライセンスが必要です。
  • 必要な Java バージョンはどれですか? JDK 1.8 以上。
  • スキャン画像からテキストを抽出できますか? はい – OCR エンジンは画像テキスト(Java)をシームレスに読み取ります。
  • 警告はどのように取得しますか? OcrEventHandler を使用して抽出後に取得します。

Java における OCR 警告の処理とは何ですか?

Java の OCR 警告処理は、OCR エンジンが遭遇するすべての問題(低解像度画像、サポートされていないフォント、曖昧な文字など)を捕捉し、対処できるようにします。これらの警告を確認することで、前処理手順を微調整し、認識精度を向上させ、下流プロセスがクリーンで信頼できるテキストを受け取れるよう保証します。

なぜ GroupDocs.Parser と Aspose OCR を使用するのか?

GroupDocs.Parser と Aspose OCR を組み合わせることで、統一された高性能パイプラインが得られます。30 以上 の文書および画像フォーマットをサポートし、標準印刷テキストで 99 % 超 の文字レベル精度を提供し、単一バッチで 最大 10,000 ページ をメモリに全体を読み込まずに処理できます。組み込みの OcrEventHandler がすべての警告を表面化し、プログラムから対応できるようにします。

前提条件

必要なライブラリと依存関係

  • GroupDocs.Parser for Java バージョン 25.5。
  • Aspose OCR コネクタ(AsposeOcrOnPremise)。
  • Maven または手動 JAR 管理。

環境設定要件

  • JDK 1.8 以上。
  • IntelliJ IDEA、Eclipse、NetBeans などの IDE。

知識の前提条件

  • 基本的な OCR の概念。
  • Java のイベントハンドリングに関する知識。

これらの前提条件が満たされれば、開始する準備が整います。

GroupDocs.Parser for Java の設定

Maven のインストール

リポジトリと依存関係を pom.xml に追加します:

<repositories>
   <repository>
      <id>repository.groupdocs.com</id>
      <name>GroupDocs Repository</name>
      <url>https://releases.groupdocs.com/parser/java/</url>
   </repository>
</repositories>

<dependencies>
   <dependency>
      <groupId>com.groupdocs</groupId>
      <artifactId>groupdocs-parser</artifactId>
      <version>25.5</version>
   </dependency>
</dependencies>

直接ダウンロード

あるいは、最新バージョンを GroupDocs.Parser for Java releases からダウンロードしてください。

ライセンス取得

  • 評価のために無料トライアルまたは一時ライセンスで開始します。
  • 本番環境のデプロイにはフルライセンスを購入します。

基本的な初期化と設定

import com.groupdocs.parser.Parser;
import com.groupdocs.parser.data.TextReader;
import com.groupdocs.parser.options.OcrEventHandler;
import com.groupdocs.parser.options.ParserSettings;
import com.groupdocs.parser.options.OcrOptions;

ParserSettings settings = new ParserSettings(new AsposeOcrOnPremise());

実装ガイド

OCR 警告処理機能

ステップ 1: ParserSettings のインスタンスを作成する

ParserSettings は GroupDocs.Parser エンジンを構成し、OCR コネクタや処理オプションを指定できるようにします。

ParserSettings settings = new ParserSettings(new AsposeOcrOnPremise());

ステップ 2: Parser クラスを初期化する

Parser は、定義した設定に従って文書を読み取るコアオブジェクトです。

try (Parser parser = new Parser("YOUR_DOCUMENT_DIRECTORY", settings)) {
    // Further processing steps will go here.
}

ステップ 3: OCR イベントハンドラを設定する

OcrEventHandler は OCR 実行中に低 DPI や未認識シンボルなどの警告を捕捉します。

OcrEventHandler handler = new OcrEventHandler();

ステップ 4: OcrOptions を構成する

OcrOptions は OcrEventHandler を OCR エンジンに結び付け、言語パック、DPI、その他のパラメータを微調整できるようにします。

OcrOptions ocrOptions = new OcrOptions(null, handler);

ステップ 5: テキスト抽出オプションを定義する

TextOptions は、抽出されたテキストをプレーン、フォーマット済み、またはレイアウト情報付きで返す方法をパーサーに指示します。

textOptions options = new TextOptions(false, true, ocrOptions);

ステップ 6: テキストを抽出し、警告を処理する

抽出プロセスを呼び出します。エンジンは遭遇した警告をイベントハンドラに格納します。

try (TextReader reader = parser.getText(options)) {
    if (reader == null) {
        System.out.println("Text extraction isn't supported");
    } else {
        System.out.println(reader.readToEnd());
    }
}

ステップ 7: OCR 警告を確認する

抽出後、ハンドラの警告コレクションを問い合わせ、各エントリをログに記録するか対処します。

if (handler.hasWarnings()) {
    System.out.println("The following warnings occur while text recognition:");
    for (String warning : handler.getWarnings()) {
        System.out.println("\t* " + warning);
    }
} else {
    System.out.println("Text recognition was performed without any warning.");
}

実用的な応用例

OCR と警告処理の統合は、さまざまなシナリオで大きなメリットをもたらします:

  1. 文書のデジタル化: 物理文書を編集可能なフォーマットに自動変換し、潜在的なエラーを捕捉します。
  2. データ入力の自動化: 手動データ入力作業を削減し、効率と精度を向上させます。
  3. コンテンツのアーカイブ: 画像やスキャン文書からテキストを抽出し、警告管理により完全性を確保したデジタルアーカイブを実現します。
  4. CMS との統合: コンテンツ管理システム内で画像ベースのソースからコンテンツ作成を自動化します。
  5. E コマースのカタログ作成: 画像から製品情報を取得し、カタログ更新を迅速化します。

パフォーマンス上の考慮点

OCR のパフォーマンスを最適化することで、Java サービスの応答性を保つことができます:

  • リソース管理: 十分なヒープメモリを割り当て、ストリームは速やかに閉じます。
  • バッチ処理: ファイルをバッチにまとめてオーバーヘッドを削減します。
  • 非同期処理: OCR を別スレッドで実行するか、CompletableFuture を使用してメインワークフローのブロックを回避します。

よくある質問

Q: GroupDocs.Parser for Java は何に使われますか?
A: 多くの文書フォーマットからデータを抽出する強力なライブラリで、OCR 駆動のテキスト抽出も含まれます。

Q: OCR 警告を効果的に処理するにはどうすればよいですか?
A: OcrEventHandler を設定し、OcrOptions とリンクします。抽出後、handler.getWarnings() を問い合わせてすべての問題を確認します。

Q: ライセンスなしで GroupDocs.Parser を使用できますか?
A: はい、トライアル版が利用可能ですが、機能に制限があります。フルライセンスを取得すれば制限が解除されます。

Q: この方法で PDF や TIFF から画像テキスト(Java)を読み取れますか?
A: もちろんです。OCR エンジンはサポートされている画像ベースの文書タイプ全般で動作し、画像テキスト(Java) を確実に読み取れます。

Q: 警告の数を減らすにはどうすればよいですか?
A: 画像を前処理(DPI を上げ、コントラストを改善)し、ソース素材に合わせて言語パックなど OCR 設定を構成します。


最終更新日: 2026-09-02
テスト環境: GroupDocs.Parser 25.5, Aspose OCR On‑Premise (latest)
作者: GroupDocs

関連チュートリアル