Textebene
Definition
Der maschinenlesbare Text, der in einem Dokument neben seiner visuellen Darstellung gespeichert ist. Er ermöglicht Suche und Textauswahl und ist genau das, was eine gescannte Seite nicht hat.
Ein von Anfang an digitales PDF enthält sowohl eine Zeichnung jedes Glyphen als auch einen Datensatz, welches Zeichen dieser Glyphe entspricht. Die Suche funktioniert, weil das zweite Element existiert. Eine gescannte Seite enthält nur das Bild – visuell identisch, funktional inert.
Dies ist die häufigste Ursache für Verwirrung bei Dokumentensuchprojekten. „Suche funktioniert bei diesen Dateien nicht“ bedeutet fast immer „diese Dateien wurden gescannt“, und keine Feinabstimmung der Suchmaschine ändert das. Die Lösung ist OCR, das eine andere und deutlich teurere Operation ist.
Office-Formate sind der einfache Fall: Ein DOCX oder XLSX ist von Natur aus strukturierter Text, sodass die Textebene nie in Frage kommt.
In Doconut
Die Volltextsuche läuft gegen die Textebene und wird vom kostenpflichtigen AdvancedSearch‑Plugin bereitgestellt. Wenn ein Dokument keine Textebene hat, wird es korrekt dargestellt, liefert jedoch keine Suchtreffer.
Verwandte Begriffe
OCR (optische Zeichenerkennung)
Rekonstruktion von maschinenlesbarem Text aus einem Bild einer Seite — der Vorgang, der einem gescannten Dokument die Textschicht verleiht, die es nie hatte.
Serverseitige Dokumentenrenderung
Umwandlung eines Dokuments in Seitenbilder auf dem Server, sodass der Browser gerenderte Seiten anzeigt, anstatt die Originaldatei selbst zu parsen.
Dokumenten-Konvertierung
Eine Datei von einem Format in ein anderes zu transformieren und eine neue Datei zu erzeugen, im Gegensatz zum Rendern, das eine temporäre visuelle Darstellung erzeugt und kein neues Artefakt.