OCR (оптичне розпізнавання символів)
Визначення
Відтворення машинозчитуваного тексту з зображення сторінки — операція, яка надає сканованому документу текстовий шар, якого він ніколи не мав.
OCR — це проблема розпізнавання, а не парсингу, тому він є ймовірнісним у спосіб, який інші частини конвеєра документів не мають. Точність залежить від роздільної здатності сканування, контрасту, нахилу, мови, шрифту та складності розкладки. Чистий надрукований текст у 300 DPI майже розв’язаний. Факсовий копіювальний лист рукописної форми — ні.
Ця змінність має практичний наслідок, який люди недооцінюють: вихід OCR — це доказ того, що сторінка, ймовірно, містить, а не точна транскрипція. Пошук по архівах з OCR слід розглядати як допоміжний інструмент, а не як гарантію, і будь‑яка юридично важлива інформація має бути перевірена проти відображеної сторінки.
OCR також вимагає значно більше обчислювальних ресурсів, ніж рендеринг, тому зазвичай це пакетна операція над архівом, а не те, що запускається під час відкриття файлу користувачем.
У Doconut
OCR доступний лише через платний плагін AdvancedSearch, і наразі не є загальнодоступним — OCR‑движок перебудовується. Не плануйте роботу навколо Doconut OCR і не описуйте його як безкоштовну або вбудовану можливість. Документи, які надходять у вигляді сканів, рендеряться правильно; вони просто не підлягають пошуку.
Пов'язані терміни
Текстовий шар
Машиночитаємий текст, що зберігається в документі разом із його візуальним виглядом. Це те, що робить можливим пошук і виділення тексту, і саме чого не має сканована сторінка.
Перетворення документів
Перетворення файлу з одного формату в інший і створення нового файлу, на відміну від рендерингу, який створює тимчасове візуальне представлення і не створює новий артефакт.