OCR (optické rozpoznávání znaků)

Definice

Rekonstrukce strojově čitelného textu z obrázku stránky — operace, která skenovanému dokumentu poskytuje textovou vrstvu, kterou nikdy neměl.

OCR je problém rozpoznávání, ne parsování, což je důvod, proč je pravděpodobnostní způsobem, který zbytek dokumentového řetězce není. Přesnost závisí na rozlišení skenu, kontrastu, sklonu, jazyce, typografii a složitosti rozvržení. Čistý tištěný text 300 DPI je téměř vyřešený. Faxová karbonová kopie ručně psaného formuláře není.

Tato variabilita má praktické důsledky, které lidé podceňují: výstup OCR je důkazem toho, co stránka pravděpodobně říká, nikoli věrným přepisem. Vyhledávání v archivech s OCR by mělo být považováno za pomůcku pro vyhledávání spíše než za záruku a vše, co má právní dopad, by mělo být ověřeno proti vykreslené stránce.

OCR také vyžaduje podstatně více výpočetního výkonu než vykreslování, což je důvod, proč je obvykle prováděno jako dávková operace nad archivem, místo aby se spouštělo při otevření souboru uživatelem.

V Doconut

OCR je k dispozici pouze prostřednictvím placeného pluginu AdvancedSearch a dnes není obecně dostupné — OCR engine je přestavován. Neplánujte kolem Doconut OCR a nepopisujte jej jako bezplatnou nebo vestavěnou funkci. Dokumenty, které přicházejí jako skeny, se vykreslí správně; jednoduše nejsou prohledávatelné.

Podívejte se, jak to funguje v praxi

Definice vás dovedou jen tak daleko. Dočasná licence běží na vašem vlastním počítači, s vašimi vlastními dokumenty.