OCR (optisk teckenigenkänning)

Definition

Att rekonstruera maskinläsbar text från en bild av en sida — operationen som ger ett skannat dokument ett textlager som det aldrig föddes med.

OCR är ett igenkänningsproblem, inte ett parsingsproblem, vilket är varför det är probabilistiskt på ett sätt som resten av dokumentpipeline inte är. Noggrannheten beror på skanningsupplösning, kontrast, snedvridning, språk, typsnitt och layoutkomplexitet. Ren 300 DPI tryckt text är nästan löst. En faxad kopia av ett handskrivet formulär är det inte.

Den variationen har en praktisk konsekvens som folk underskattar: OCR-utdata är bevis på vad en sida sannolikt säger, inte en trogen transkription. Sökning i OCR:ade arkiv bör behandlas som ett återkallningshjälpmedel snarare än en garanti, och allt som är juridiskt avgörande bör verifieras mot den renderade sidan.

OCR kräver också avsevärt mer beräkningskraft än rendering, vilket är varför det vanligtvis är en batchoperation över ett arkiv snarare än något du kör när en användare öppnar en fil.

I Doconut

OCR levereras endast via den betalda AdvancedSearch‑pluginen, och är inte allmänt tillgänglig idag — OCR‑motorn håller på att ombaseras. Planera inte kring Doconut OCR, och beskriv det inte som en gratis eller inbyggd funktion. Dokument som kommer som skanningar renderas korrekt; de är helt enkelt inte sökbara.

Se hur det fungerar i praktiken

Definitioner tar dig bara så långt. En tillfällig licens körs på din egen maskin, mot dina egna dokument.