Couche de texte
Définition
Le texte lisible par machine stocké à l’intérieur d’un document aux côtés de son apparence visuelle. C’est ce qui rend la recherche et la sélection de texte possibles, et c’est exactement ce qui manque à une page numérisée.
Un PDF né-numérique contient à la fois le dessin de chaque glyphe et un enregistrement du caractère que ce glyphe représente. La recherche fonctionne parce que la seconde chose existe. Une page numérisée ne contient que l’image — visuellement identique, fonctionnellement inerte.
C’est la source la plus courante de confusion dans les projets de recherche de documents. « La recherche ne fonctionne pas sur ces fichiers » signifie presque toujours « ces fichiers ont été numérisés », et aucune optimisation du moteur de recherche ne change cela. La solution est l’OCR, qui est une opération différente et nettement plus coûteuse.
Les formats bureautiques sont le cas le plus simple : un DOCX ou un XLSX est du texte structuré par nature, donc la couche de texte n’est jamais en cause.
Dans Doconut
La recherche en texte intégral s’appuie sur la couche de texte et est fournie par le plugin payant AdvancedSearch. Si un document n’a pas de couche de texte, il s’affiche correctement mais ne renvoie aucun résultat de recherche.
Termes associés
OCR (reconnaissance optique de caractères)
Reconstruire du texte lisible par machine à partir d'une image d'une page — l'opération qui donne à un document numérisé la couche de texte qu'il n'a jamais eue.
Rendu de document côté serveur
Conversion d'un document en images de pages sur le serveur, de sorte que le navigateur affiche des pages rendues plutôt que d'analyser le fichier original lui‑même.
Conversion de documents
Transformer un fichier d'un format à un autre et produire un nouveau fichier, contrairement au rendu qui produit une représentation visuelle temporaire et aucun nouvel artefact.