OCR (optisk teckenigenkänning)
Definition
Att rekonstruera maskinläsbar text från en bild av en sida — operationen som ger ett skannat dokument ett textlager som det aldrig föddes med.
OCR är ett igenkänningsproblem, inte ett parsingsproblem, vilket är varför det är probabilistiskt på ett sätt som resten av dokumentpipeline inte är. Noggrannheten beror på skanningsupplösning, kontrast, snedvridning, språk, typsnitt och layoutkomplexitet. Ren 300 DPI tryckt text är nästan löst. En faxad kopia av ett handskrivet formulär är det inte.
Den variationen har en praktisk konsekvens som folk underskattar: OCR-utdata är bevis på vad en sida sannolikt säger, inte en trogen transkription. Sökning i OCR:ade arkiv bör behandlas som ett återkallningshjälpmedel snarare än en garanti, och allt som är juridiskt avgörande bör verifieras mot den renderade sidan.
OCR kräver också avsevärt mer beräkningskraft än rendering, vilket är varför det vanligtvis är en batchoperation över ett arkiv snarare än något du kör när en användare öppnar en fil.
I Doconut
OCR levereras endast via den betalda AdvancedSearch‑pluginen, och är inte allmänt tillgänglig idag — OCR‑motorn håller på att ombaseras. Planera inte kring Doconut OCR, och beskriv det inte som en gratis eller inbyggd funktion. Dokument som kommer som skanningar renderas korrekt; de är helt enkelt inte sökbara.
Relaterade termer
Textlager
Den maskinläsbara texten som lagras i ett dokument tillsammans med dess visuella utseende. Det är det som gör sökning och textmarkering möjliga, och det är exakt det en skannad sida saknar.
Dokumentkonvertering
Att omvandla en fil från ett format till ett annat och skapa en ny fil, till skillnad från rendering, som producerar en tillfällig visuell representation och ingen ny artefakt.