Извлечение штрих‑кода из PDF с помощью GroupDocs.Parser Java

В этом руководстве вы узнаете, как извлечь штрих‑код из PDF файлов с помощью GroupDocs.Parser for Java, а также как тот же движок шаблонов может извлечь таблицу из PDF Java и извлечь данные из PDF Java надёжным, повторяемым способом. Независимо от того, создаёте ли вы решение для сканирования, автоматизируете обработку счетов или просто нужно получить структурированную информацию из полуструктурированных документов, эти уроки покажут, как настроить и запустить парсинг на основе шаблонов в Java.

Быстрые ответы

  • Что я могу извлечь? Штрих‑коды, таблицы и пользовательские поля данных из PDF‑документов.
  • Какая библиотека требуется? GroupDocs.Parser for Java (последняя версия).
  • Нужна ли лицензия? Временная лицензия подходит для тестирования; полная лицензия требуется для продакшн.
  • Поддерживается ли Java 8+? Да, библиотека работает с Java 8 и более новыми средами выполнения.
  • Могу ли я обрабатывать PDF, защищённые паролем? Конечно — просто укажите пароль при загрузке документа.

Что такое парсинг на основе шаблонов?

Парсинг на основе шаблонов позволяет определить фиксированные позиции, связанные позиции или поля, основанные на регулярных выражениях, в файле шаблона. Когда PDF соответствует макету, GroupDocs.Parser автоматически извлекает заданные значения, превращая неструктурированные страницы в чистые, структурированные данные.

Почему извлекать штрих‑код из PDF с помощью GroupDocs.Parser?

  • Скорость: Шаблоны устраняют необходимость постраничного OCR, обеспечивая почти мгновенные результаты.
  • Точность: Определения фиксированных позиций или регулярных выражений снижают количество ложных срабатываний.
  • Масштабируемость: После создания шаблона его можно использовать для тысяч документов без изменения кода.
  • Интеграция: Java API естественно вписывается в существующие бэкенд‑сервисы или микросервисы.

Требования

  • Java 8 или выше установлен.
  • Maven или Gradle для управления зависимостями.
  • Библиотека GroupDocs.Parser for Java (добавьте Maven‑артефакт в ваш проект).
  • Пример PDF, содержащий штрих‑код (или таблицу) с постоянным макетом.

Пошаговое руководство

Шаг 1: Добавьте GroupDocs.Parser в ваш проект

Добавьте Maven‑зависимость в ваш pom.xml (или аналогичную запись Gradle). Этот шаг подготавливает вашу среду для парсинга по шаблону.

Шаг 2: Создайте шаблон парсинга

Определите шаблон в формате JSON или XML, описывающий, где находится штрих‑код на странице. Вы также можете добавить поле для извлечения таблицы из PDF Java, указав регион таблицы. Шаблон может включать правила regex, если необходимо захватывать данные переменной длины.

Шаг 3: Загрузите PDF и примените шаблон

Используйте класс Parser для открытия PDF, привязки шаблона и вызова метода extract. Библиотека возвращает коллекцию пар «ключ‑значение», представляющих извлечённый штрих‑код, строки таблицы или любые другие определённые вами данные.

Шаг 4: Обработайте извлечённые данные

Итерируйте набор результатов, сопоставляйте значения с объектами доменной модели и сохраняйте их в базе данных или передавайте в другой сервис. Здесь же вы можете извлечь данные из PDF Java для последующей обработки.

Шаг 5: Обработайте типовые сценарии

  • PDF, защищённые паролем: Передайте пароль в конструктор Parser.
  • Несколько страниц: Используйте поля со связанными позициями для повторного извлечения на разных страницах.
  • Обработка ошибок: Перехватывайте ParserException для корректного управления некорректными документами.

Распространённые проблемы и решения

ПроблемаРешение
Шаблон не соответствует макету PDFПроверьте координаты с помощью встроенного инструмента предварительного просмотра или скорректируйте значения фиксированных позиций.
Штрих‑код не обнаруженУбедитесь, что тип штрих‑кода поддерживается, и увеличьте разрешение изображения в настройках шаблона.
Извлечение возвращает пустые таблицыПроверьте, правильно ли определён регион таблицы, и действительно ли PDF содержит структуру таблицы.

Доступные учебные материалы

Эффективный парсинг PDF в Java с использованием шаблонов GroupDocs.Parser

Узнайте, как использовать GroupDocs.Parser for Java для парсинга PDF с шаблонными таблицами, эффективно извлекать данные и оптимизировать обработку документов.

Мастер парсинга шаблонов Java с GroupDocs.Parser: Полное руководство по регулярным выражениям и связанным полям

Узнайте, как автоматизировать извлечение данных в Java с помощью GroupDocs.Parser. Это руководство охватывает настройку, определение полей шаблона и эффективный парсинг документов.

Парсинг страниц документа по шаблону с использованием GroupDocs.Parser в Java: Полное руководство

Узнайте, как эффективно парсить страницы документов с помощью шаблонов GroupDocs.Parser for Java, сосредотачиваясь на извлечении данных штрих‑кода из PDF.

Дополнительные ресурсы

Часто задаваемые вопросы

Q: Могу ли я извлечь несколько штрих‑кодов из одного PDF?
A: Да. Определите несколько полей штрих‑кода в шаблоне или используйте поле со связанной позицией для повторного извлечения на разных страницах.

Q: Возможно ли извлекать таблицы без предварительно заданного макета?
A: Хотя парсинг по шаблону лучше всего работает с постоянными макетами, вы можете комбинировать его с OCR для динамического обнаружения структуры таблиц.

Q: Как GroupDocs.Parser обрабатывает большие PDF‑файлы?
A: Библиотека потоково читает страницы, поэтому потребление памяти остаётся низким. Для очень больших файлов обрабатывайте их пакетами или используйте метод extractPages.

Q: Нужно ли писать пользовательский код для парсинга штрих‑кодов?
A: Нет. Извлечение штрих‑кода встроено в движок шаблонов; вам нужно лишь указать тип штрих‑кода и его расположение.

Q: Какие форматы штрих‑кодов поддерживаются?
A: Поддерживаются распространённые форматы, такие как QR, Code128, EAN, UPC и DataMatrix.

Последнее обновление: 2026-02-11
Тестировано с: GroupDocs.Parser for Java 24.11
Автор: GroupDocs