Textová vrstva
Definice
Strojově čitelný text uložený v dokumentu vedle jeho vizuální podoby. Je to, co umožňuje vyhledávání a výběr textu, a přesně to, co skenovaná stránka nemá.
Digitální PDF obsahuje jak kresbu každého glifu, tak záznam o tom, který znak daný glif představuje. Vyhledávání funguje, protože existuje ta druhá věc. Skenovaná stránka obsahuje jen obrázek — vizuálně identický, funkčně nečinný.
Toto je nejčastější zdroj zmatku v projektech vyhledávání v dokumentech. „Vyhledávání v těchto souborech nefunguje“ téměř vždy znamená „tyto soubory byly naskenovány“ a žádné ladění vyhledávače to nezmění. Řešením je OCR, což je odlišná a podstatně dražší operace.
Formáty Office jsou jednoduchým případem: DOCX nebo XLSX jsou od základu strukturovaný text, takže textová vrstva není nikdy otázkou.
V Doconut
Full-textové vyhledávání probíhá na textové vrstvě a je poskytováno placeným pluginem AdvancedSearch. Pokud dokument nemá textovou vrstvu, zobrazí se správně, ale nevrátí žádné výsledky vyhledávání.
Související pojmy
OCR (optické rozpoznávání znaků)
Rekonstrukce strojově čitelného textu z obrázku stránky — operace, která skenovanému dokumentu poskytuje textovou vrstvu, kterou nikdy neměl.
Serverové vykreslování dokumentu
Převod dokumentu na obrázky stránek na serveru, takže prohlížeč zobrazuje vykreslené stránky místo parsování samotného původního souboru.
Převod dokumentu
Transformace souboru z jednoho formátu do druhého a vytvoření nového souboru, na rozdíl od vykreslování, které vytváří dočasnou vizuální reprezentaci a žádný nový artefakt.