OCR (оптичне розпізнавання символів)

Визначення

Відтворення машинозчитуваного тексту з зображення сторінки — операція, яка надає сканованому документу текстовий шар, якого він ніколи не мав.

OCR — це проблема розпізнавання, а не парсингу, тому він є ймовірнісним у спосіб, який інші частини конвеєра документів не мають. Точність залежить від роздільної здатності сканування, контрасту, нахилу, мови, шрифту та складності розкладки. Чистий надрукований текст у 300 DPI майже розв’язаний. Факсовий копіювальний лист рукописної форми — ні.

Ця змінність має практичний наслідок, який люди недооцінюють: вихід OCR — це доказ того, що сторінка, ймовірно, містить, а не точна транскрипція. Пошук по архівах з OCR слід розглядати як допоміжний інструмент, а не як гарантію, і будь‑яка юридично важлива інформація має бути перевірена проти відображеної сторінки.

OCR також вимагає значно більше обчислювальних ресурсів, ніж рендеринг, тому зазвичай це пакетна операція над архівом, а не те, що запускається під час відкриття файлу користувачем.

У Doconut

OCR доступний лише через платний плагін AdvancedSearch, і наразі не є загальнодоступним — OCR‑движок перебудовується. Не плануйте роботу навколо Doconut OCR і не описуйте його як безкоштовну або вбудовану можливість. Документи, які надходять у вигляді сканів, рендеряться правильно; вони просто не підлягають пошуку.

Подивіться, як це працює на практиці

Визначення лише частково допомагають. Тимчасова ліцензія працює на вашій машині, з вашими документами.