OCR (optické rozpoznávání znaků)
Definice
Rekonstrukce strojově čitelného textu z obrázku stránky — operace, která skenovanému dokumentu poskytuje textovou vrstvu, kterou nikdy neměl.
OCR je problém rozpoznávání, ne parsování, což je důvod, proč je pravděpodobnostní způsobem, který zbytek dokumentového řetězce není. Přesnost závisí na rozlišení skenu, kontrastu, sklonu, jazyce, typografii a složitosti rozvržení. Čistý tištěný text 300 DPI je téměř vyřešený. Faxová karbonová kopie ručně psaného formuláře není.
Tato variabilita má praktické důsledky, které lidé podceňují: výstup OCR je důkazem toho, co stránka pravděpodobně říká, nikoli věrným přepisem. Vyhledávání v archivech s OCR by mělo být považováno za pomůcku pro vyhledávání spíše než za záruku a vše, co má právní dopad, by mělo být ověřeno proti vykreslené stránce.
OCR také vyžaduje podstatně více výpočetního výkonu než vykreslování, což je důvod, proč je obvykle prováděno jako dávková operace nad archivem, místo aby se spouštělo při otevření souboru uživatelem.
V Doconut
OCR je k dispozici pouze prostřednictvím placeného pluginu AdvancedSearch a dnes není obecně dostupné — OCR engine je přestavován. Neplánujte kolem Doconut OCR a nepopisujte jej jako bezplatnou nebo vestavěnou funkci. Dokumenty, které přicházejí jako skeny, se vykreslí správně; jednoduše nejsou prohledávatelné.
Související pojmy
Textová vrstva
Strojově čitelný text uložený v dokumentu vedle jeho vizuální podoby. Je to, co umožňuje vyhledávání a výběr textu, a přesně to, co skenovaná stránka nemá.
Převod dokumentu
Transformace souboru z jednoho formátu do druhého a vytvoření nového souboru, na rozdíl od vykreslování, které vytváří dočasnou vizuální reprezentaci a žádný nový artefakt.