OCR (оптическое распознавание символов)

Определение

Восстановление машинно‑читаемого текста из изображения страницы — операция, которая придаёт отсканированному документу текстовый слой, которого у него изначально не было.

OCR — это задача распознавания, а не парсинга, поэтому она вероятностна, в отличие от остальной части конвейера обработки документов. Точность зависит от разрешения сканирования, контраста, наклона, языка, шрифта и сложности макета. Чистый печатный текст 300 DPI почти решён. Факс‑копия рукописной формы — нет.

Эта изменчивость имеет практические последствия, которые люди недооценивают: вывод OCR — это доказательство того, что страница, вероятно, говорит, а не точная транскрипция. Поиск по архивам с OCR следует рассматривать как средство повышения полноты, а не как гарантию, и любые юридически значимые сведения следует проверять по отрендеренной странице.

OCR также требует заметно больше вычислительных ресурсов, чем рендеринг, поэтому обычно это пакетная операция над архивом, а не то, что запускается при открытии файла пользователем.

В Doconut

OCR доступен только через платный плагин AdvancedSearch и в настоящее время не доступен в общем виде — движок OCR переписывается. Не планируйте работу вокруг Doconut OCR и не описывайте его как бесплатную или встроенную возможность. Документы, поступающие в виде сканов, рендерятся корректно; они просто не поддаются поиску.

Посмотрите, как это работает на практике

Определения могут лишь отчасти помочь. Временная лицензия работает на вашем компьютере, с вашими документами.