JDOC
Табличная часть

Распознавание таблиц и табличной части PDF

Шапку документа обычно можно перенести вручную за несколько минут. Настоящая рутина начинается, когда в счёте или накладной двадцать, пятьдесят или сто строк.

JDOC распознаёт табличную часть PDF-документов и возвращает строки отдельно: наименование, единицу измерения, количество, цену, суммы и другие доступные значения.

Какие данные можно извлечь из таблицы PDF

  • наименование товара или услуги;
  • единицу измерения;
  • количество;
  • цену за единицу;
  • сумму строки;
  • НДС и итоговые значения, если они есть в документе.

Почему таблицы сложнее обычного текста

В PDF визуальная колонка не всегда является настоящей таблицей. Текст может быть разбит на отдельные блоки, строки могут переноситься, а заголовки — повторяться на каждой странице.

Поэтому для бухгалтерии важно не просто прочитать символы, а сохранить связь между названием позиции, количеством, ценой и суммой в одной строке.

Что проверить после распознавания

Сверьте количество строк, несколько позиций в начале и конце таблицы, цены, НДС и общий итог. Если документ многостраничный, отдельно убедитесь, что переход между страницами не потерял строки.

После проверки табличную часть можно использовать в 1С/BAS, ERP или собственной интеграции через структурированный результат.

По теме

Вопросы по теме

Можно ли извлечь таблицу из PDF в структурированном виде?

Да. JDOC возвращает табличную часть строками, если структуру документа удалось определить.

Распознаются ли многостраничные таблицы?

JDOC работает с многостраничными документами, но полноту строк и итоги нужно проверять по исходному PDF.

Проверить на своём документе

Загрузите свой PDF, скан или фото и сравните распознанные данные с оригиналом перед использованием в учёте.