OCR (optische Zeichenerkennung)
Definition
Rekonstruktion von maschinenlesbarem Text aus einem Bild einer Seite — der Vorgang, der einem gescannten Dokument die Textschicht verleiht, die es nie hatte.
OCR ist ein Erkennungsproblem, kein Parsing-Problem, weshalb es probabilistisch ist, anders als der Rest der Dokumentpipeline. Die Genauigkeit hängt von Scanauflösung, Kontrast, Schräglage, Sprache, Schriftart und Layoutkomplexität ab. Sauberer 300‑DPI‑gedruckter Text ist fast gelöst. Eine gefaxte Kohlenkopie eines handschriftlichen Formulars ist es nicht.
Diese Variabilität hat eine praktische Folge, die Menschen unterschätzen: OCR‑Ausgabe ist ein Hinweis darauf, was eine Seite wahrscheinlich sagt, nicht ein getreues Transkript. Die Suche in OCR‑basierten Archiven sollte als Hilfsmittel zur Wiederauffindung und nicht als Garantie behandelt werden, und alles, was rechtlich relevant ist, sollte gegen die gerenderte Seite verifiziert werden.
OCR verbraucht zudem deutlich mehr Rechenleistung als das Rendern, weshalb es in der Regel ein Batch‑Vorgang über ein Archiv ist und nicht etwas, das Sie ausführen, wenn ein Benutzer eine Datei öffnet.
In Doconut
OCR wird nur über das kostenpflichtige AdvancedSearch‑Plugin bereitgestellt und ist heute nicht allgemein verfügbar — die OCR‑Engine wird neu aufgebaut. Planen Sie nicht um Doconut OCR herum und beschreiben Sie es nicht als kostenlose oder integrierte Funktion. Dokumente, die als Scans ankommen, werden korrekt gerendert; sie sind einfach nicht durchsuchbar.
Verwandte Begriffe
Textebene
Der maschinenlesbare Text, der in einem Dokument neben seiner visuellen Darstellung gespeichert ist. Er ermöglicht Suche und Textauswahl und ist genau das, was eine gescannte Seite nicht hat.
Dokumenten-Konvertierung
Eine Datei von einem Format in ein anderes zu transformieren und eine neue Datei zu erzeugen, im Gegensatz zum Rendern, das eine temporäre visuelle Darstellung erzeugt und kein neues Artefakt.