is? The phrase is part of text; we can translate but keep bold formatting. Keep the bold markers. So “How to use OCR” becomes “OCR 사용 방법”? but keep bold. We’ll translate.
Next: “What You’ll Learn” header? Actually it’s a bold line. Keep as is but translate: “배울 내용”. Keep bold.
List items.
Proceed similarly.
Need to translate table.
Also code block placeholders remain unchanged.
Make sure not to translate URLs.
Let’s craft translation.
Will keep markdown formatting.
Proceed step by step.
GroupDocs.Parser Java로 OCR 사용 방법
이미지나 스캔된 문서에서 텍스트를 효율적으로 추출하고 싶으신가요? OCR 사용 방법은 Java용 GroupDocs.Parser 라이브러리를 활용한 강력한 솔루션으로, Optical Character Recognition (OCR)을 애플리케이션에 원활히 통합할 수 있습니다. 이 포괄적인 가이드는 Aspose OCR 커넥터와 함께 GroupDocs.Parser를 사용해 Java에서 이미지 파일의 텍스트 영역을 추출하는 방법을 단계별로 안내하여 문서 처리 능력을 향상시킵니다.
배울 내용
- Java용 GroupDocs.Parser 설정 및 사용 방법
- OCR 커넥터와 함께
ParserSettings초기화 - Aspose OCR 기술을 이용해 이미지에서 텍스트 영역 추출 기법
- java image to text 변환 및 Java에서 텍스트 위치 추출과 같은 실제 시나리오에 대한 실용적인 적용
빠른 답변
- “OCR 사용 방법”이란 무엇인가요? 이미지 기반 파일에서 텍스트를 읽기 위해 OCR 엔진을 통합하는 것을 의미합니다.
- Java용 OCR을 제공하는 라이브러리는 무엇인가요? Aspose OCR 커넥터와 결합된 GroupDocs.Parser입니다.
- 라이선스가 필요하나요? 무료 체험판을 사용할 수 있으며, 프로덕션 환경에서는 영구 라이선스가 필요합니다.
- 텍스트 좌표를 얻을 수 있나요? 예, API는 텍스트 영역 위치(왼쪽, 위, 너비, 높이)를 반환합니다.
- 필요한 Java 버전은 무엇인가요? Java 8 이상을 권장합니다.
OCR 텍스트 추출이란?
Optical Character Recognition (OCR)은 스캔 이미지, PDF 또는 사진에 포함된 시각적 텍스트를 기계가 읽을 수 있는 문자로 변환합니다. Java에서 OCR 사용 방법을 적용하면 정적 문서를 검색, 편집 및 분석할 수 있게 됩니다.
GroupDocs.Parser를 OCR에 사용하는 이유
- 통합 API – PDF, 이미지 등 다양한 형식을 단일 코드 베이스로 처리합니다.
- 정확한 인식 – 다국어 및 다양한 폰트를 지원하는 Aspose OCR이 구동됩니다.
- 위치 데이터 – 각 텍스트 블록의 정확한 좌표를 제공하여 레이아웃 인식 처리에 최적입니다.
- 확장성 – 작은 이미지부터 대용량 배치 작업까지 지원하며, 온프레미스와 클라우드 모두에서 실행할 수 있습니다.
사전 요구 사항
시작하기 전에 다음 항목을 준비하십시오.
필수 라이브러리 및 종속성
- GroupDocs.Parser for Java: 버전 25.5 이상.
- Maven 또는 직접 다운로드 방식으로 라이브러리 설치.
- Aspose OCR Connector: Aspose OCR 기술에 대한 접근 권한이 필요합니다.
환경 설정 요구 사항
- Java 8+이 설치된 호환 IDE (IntelliJ IDEA, Eclipse 등).
- Maven을 사용하는 경우 Maven이 설치되어 있어야 합니다.
지식 사전 조건
- 기본적인 Java 프로그래밍 능력.
- 프로젝트 종속성 관리에 대한 이해.
GroupDocs.Parser for Java 설정
라이브러리를 Maven을 통해 추가하거나 직접 다운로드할 수 있습니다.
Maven 사용
pom.xml 파일에 다음 구성을 추가하십시오:
<repositories>
<repository>
<id>repository.groupdocs.com</id>
<name>GroupDocs Repository</name>
<url>https://releases.groupdocs.com/parser/java/</url>
</repository>
</repositories>
<dependencies>
<dependency>
<groupId>com.groupdocs</groupId>
<artifactId>groupdocs-parser</artifactId>
<version>25.5</version>
</dependency>
</dependencies>
직접 다운로드
또는 GroupDocs.Parser for Java releases에서 최신 버전을 다운로드하십시오.
라이선스 획득 단계
- 무료 체험 – 비용 없이 라이브러리를 평가합니다.
- 임시 라이선스 – 제한된 기간 동안 사용할 수 있는 키를 제공합니다.
- 구매 – 프로덕션 배포를 위한 정식 라이선스를 획득합니다.
기본 초기화 및 설정
라이브러리를 사용할 준비가 되면 파서를 초기화합니다. 아래는 Aspose OCR 커넥터와 함께 ParserSettings 인스턴스를 생성하는 핵심 Java 코드입니다:
import com.groupdocs.parser.Parser;
import com.groupdocs.parser.options.ParserSettings;
import com.groupdocs.parser.ocr.AsposeOcrOnPremise;
ParserSettings settings = new ParserSettings(new AsposeOcrOnPremise());
기본 설정을 마쳤으니 이제 OCR 텍스트 영역 추출로 들어가겠습니다.
OCR로 텍스트 영역 추출하기 (단계별)
1. OCR 커넥터와 함께 ParserSettings 초기화
OCR 커넥터는 이미지 전용 문서에서 텍스트 인식을 가능하게 합니다.
// Initialize ParserSettings with OCR Connector
ParserSettings settings = new ParserSettings(new AsposeOcrOnPremise());
2. 문서를 열고 추출 옵션 구성
PageTextAreaOptions를 사용하여 파서가 인식된 각 단어에 대한 위치 데이터를 반환하도록 지정합니다.
try (Parser parser = new Parser("YOUR_DOCUMENT_DIRECTORY", settings)) {
// Configure PageTextAreaOptions for OCR processing
PageTextAreaOptions options = new PageTextAreaOptions(true);
// Extract text areas from the document
java.lang.Iterable<PageTextArea> areas = parser.getTextAreas(options);
if (areas == null) {
return; // Exit if text areas extraction is not supported
}
for (PageTextArea a : areas) {
String text = a.getText();
int leftPosition = a.getRectangle().getLeft();
int topPosition = a.getRectangle().getTop();
int width = a.getRectangle().getSize().getWidth();
int height = a.getRectangle().getSize().getHeight();
// Process the extracted data as needed
}
} catch (java.lang.Exception ex) {
// Handle any exceptions that occur during processing
}
코드 설명
- Parser 인스턴스를 생성해 문서 폴더를 지정합니다.
PageTextAreaOptions(true)를 통해 OCR을 활성화합니다.- 각
PageTextArea를 순회하면서 인식된 텍스트 와 정확한 사각형(위치 및 크기)을 얻습니다. - 추출한 데이터를 데이터베이스에 저장하거나 UI에 오버레이하는 등 다양한 방식으로 활용할 수 있습니다.
3. 결과 처리
이제 추출된 텍스트와 좌표를 다양한 시나리오에 활용할 수 있습니다.
- 문서 디지털화 – 스캔된 계약서를 검색 가능한 PDF로 변환합니다.
- 데이터 입력 자동화 – 영수증 이미지에서 청구서 번호와 같은 필드를 직접 추출합니다.
- 콘텐츠 관리 – 고급 검색 하이라이트를 위해 텍스트 위치를 인덱싱합니다.
일반적인 문제와 해결책
| 증상 | 가능 원인 | 해결 방법 |
|---|---|---|
| 텍스트 영역이 반환되지 않음 | OCR 커넥터가 설정되지 않았거나 이미지 경로가 잘못됨 | AsposeOcrOnPremise 인스턴스가 올바르게 라이선스되었는지, 파일 경로에 접근 가능한지 확인합니다. |
| 문자 깨짐 | 이미지 품질이 낮거나 지원되지 않는 언어 | 고해상도 스캔을 사용하고 OCR 언어 팩을 설정합니다. |
| 대용량 PDF에서 메모리 부족 오류 | 한 번에 많은 고해상도 페이지를 처리 | 페이지를 배치별로 처리하거나 스트리밍 모드(ParserSettings.setEnableStreaming(true))를 활성화합니다. |
자주 묻는 질문
Q: GroupDocs.Parser for Java를 어떻게 설치하나요?
A: Maven 의존성으로 추가하거나(위 XML 스니펫 참고) 공식 릴리스 페이지에서 직접 다운로드합니다.
Q: Aspose OCR이란 무엇이며, 왜 GroupDocs.Parser와 함께 사용하나요?
A: Aspose OCR은 고정밀 텍스트 인식 엔진입니다. GroupDocs.Parser와 결합하면 이미지 전용 파일을 처리하고 정확한 텍스트 위치를 제공하는 기능이 확장됩니다.
Q: 여러 이미지 포맷을 처리할 수 있나요?
A: 예. GroupDocs.Parser는 JPEG, PNG, BMP, TIFF 등 다양한 포맷을 지원합니다—단 OCR 커넥터가 해당 포맷을 읽을 수 있어야 합니다.
Q: 텍스트 영역이 전혀 추출되지 않으면 어떻게 해야 하나요?
A: 파일 경로를 확인하고, OCR 커넥터가 라이선스되었는지, 문서 유형이 Aspose OCR에서 지원되는지 검증하십시오.
Q: GroupDocs.Parser에 대한 추가 자료는 어디서 찾을 수 있나요?
A: 자세한 가이드와 API 레퍼런스는 GroupDocs Documentation을 방문하십시오.
리소스
- Documentation
- API Reference
- Download Latest Version
- GitHub Repository
- Free Support Forum
- Temporary License
위 리소스를 활용해 GroupDocs.Parser의 기능을 깊이 이해하고 프로젝트에 적용 범위를 넓혀 보세요.
마지막 업데이트: 2026-02-09
테스트 환경: GroupDocs.Parser 25.5 for Java
작성자: GroupDocs