Распознавание таблиц и табличной части PDF
Шапку документа обычно можно перенести вручную за несколько минут. Настоящая рутина начинается, когда в счёте или накладной двадцать, пятьдесят или сто строк.
JDOC распознаёт табличную часть PDF-документов и возвращает строки отдельно: наименование, единицу измерения, количество, цену, суммы и другие доступные значения.
Какие данные можно извлечь из таблицы PDF
- наименование товара или услуги;
- единицу измерения;
- количество;
- цену за единицу;
- сумму строки;
- НДС и итоговые значения, если они есть в документе.
Почему таблицы сложнее обычного текста
В PDF визуальная колонка не всегда является настоящей таблицей. Текст может быть разбит на отдельные блоки, строки могут переноситься, а заголовки — повторяться на каждой странице.
Поэтому для бухгалтерии важно не просто прочитать символы, а сохранить связь между названием позиции, количеством, ценой и суммой в одной строке.
Что проверить после распознавания
Сверьте количество строк, несколько позиций в начале и конце таблицы, цены, НДС и общий итог. Если документ многостраничный, отдельно убедитесь, что переход между страницами не потерял строки.
После проверки табличную часть можно использовать в 1С/BAS, ERP или собственной интеграции через структурированный результат.
По теме
Вопросы по теме
Можно ли извлечь таблицу из PDF в структурированном виде?
Да. JDOC возвращает табличную часть строками, если структуру документа удалось определить.
Распознаются ли многостраничные таблицы?
JDOC работает с многостраничными документами, но полноту строк и итоги нужно проверять по исходному PDF.
Проверить на своём документе
Загрузите свой PDF, скан или фото и сравните распознанные данные с оригиналом перед использованием в учёте.