Couche de texte

Définition

Le texte lisible par machine stocké à l’intérieur d’un document aux côtés de son apparence visuelle. C’est ce qui rend la recherche et la sélection de texte possibles, et c’est exactement ce qui manque à une page numérisée.

Un PDF né-numérique contient à la fois le dessin de chaque glyphe et un enregistrement du caractère que ce glyphe représente. La recherche fonctionne parce que la seconde chose existe. Une page numérisée ne contient que l’image — visuellement identique, fonctionnellement inerte.

C’est la source la plus courante de confusion dans les projets de recherche de documents. « La recherche ne fonctionne pas sur ces fichiers » signifie presque toujours « ces fichiers ont été numérisés », et aucune optimisation du moteur de recherche ne change cela. La solution est l’OCR, qui est une opération différente et nettement plus coûteuse.

Les formats bureautiques sont le cas le plus simple : un DOCX ou un XLSX est du texte structuré par nature, donc la couche de texte n’est jamais en cause.

Dans Doconut

La recherche en texte intégral s’appuie sur la couche de texte et est fournie par le plugin payant AdvancedSearch. Si un document n’a pas de couche de texte, il s’affiche correctement mais ne renvoie aucun résultat de recherche.

Voir comment cela fonctionne en pratique

Les définitions ne vous mènent que jusqu'ici. Une licence temporaire s'exécute sur votre propre machine, avec vos propres documents.