Textebene

Definition

Der maschinenlesbare Text, der in einem Dokument neben seiner visuellen Darstellung gespeichert ist. Er ermöglicht Suche und Textauswahl und ist genau das, was eine gescannte Seite nicht hat.

Ein von Anfang an digitales PDF enthält sowohl eine Zeichnung jedes Glyphen als auch einen Datensatz, welches Zeichen dieser Glyphe entspricht. Die Suche funktioniert, weil das zweite Element existiert. Eine gescannte Seite enthält nur das Bild – visuell identisch, funktional inert.

Dies ist die häufigste Ursache für Verwirrung bei Dokumentensuchprojekten. „Suche funktioniert bei diesen Dateien nicht“ bedeutet fast immer „diese Dateien wurden gescannt“, und keine Feinabstimmung der Suchmaschine ändert das. Die Lösung ist OCR, das eine andere und deutlich teurere Operation ist.

Office-Formate sind der einfache Fall: Ein DOCX oder XLSX ist von Natur aus strukturierter Text, sodass die Textebene nie in Frage kommt.

In Doconut

Die Volltextsuche läuft gegen die Textebene und wird vom kostenpflichtigen AdvancedSearch‑Plugin bereitgestellt. Wenn ein Dokument keine Textebene hat, wird es korrekt dargestellt, liefert jedoch keine Suchtreffer.

Sehen Sie, wie es in der Praxis funktioniert

Definitionen bringen Sie nur so weit. Eine temporäre Lizenz läuft auf Ihrer eigenen Maschine, mit Ihren eigenen Dokumenten.