OCR (оптическое распознавание символов)
Определение
Восстановление машинно‑читаемого текста из изображения страницы — операция, которая придаёт отсканированному документу текстовый слой, которого у него изначально не было.
OCR — это задача распознавания, а не парсинга, поэтому она вероятностна, в отличие от остальной части конвейера обработки документов. Точность зависит от разрешения сканирования, контраста, наклона, языка, шрифта и сложности макета. Чистый печатный текст 300 DPI почти решён. Факс‑копия рукописной формы — нет.
Эта изменчивость имеет практические последствия, которые люди недооценивают: вывод OCR — это доказательство того, что страница, вероятно, говорит, а не точная транскрипция. Поиск по архивам с OCR следует рассматривать как средство повышения полноты, а не как гарантию, и любые юридически значимые сведения следует проверять по отрендеренной странице.
OCR также требует заметно больше вычислительных ресурсов, чем рендеринг, поэтому обычно это пакетная операция над архивом, а не то, что запускается при открытии файла пользователем.
В Doconut
OCR доступен только через платный плагин AdvancedSearch и в настоящее время не доступен в общем виде — движок OCR переписывается. Не планируйте работу вокруг Doconut OCR и не описывайте его как бесплатную или встроенную возможность. Документы, поступающие в виде сканов, рендерятся корректно; они просто не поддаются поиску.
Связанные термины
Текстовый слой
Машинно‑читаемый текст, хранящийся внутри документа вместе с его визуальным отображением. Он делает возможным поиск и выделение текста, и именно этого не имеет сканированная страница.
Преобразование документов
Преобразование файла из одного формата в другой с созданием нового файла, в отличие от рендеринга, который создает временное визуальное представление и не производит новый артефакт.