OCR (reconnaissance optique de caractères)

Définition

Reconstruire du texte lisible par machine à partir d'une image d'une page — l'opération qui donne à un document numérisé la couche de texte qu'il n'a jamais eue.

L'OCR est un problème de reconnaissance, pas de parsing, ce qui explique pourquoi il est probabiliste d'une manière que le reste du pipeline de documents ne l'est pas. La précision dépend de la résolution du scan, du contraste, de l'inclinaison, de la langue, de la police et de la complexité de la mise en page. Un texte imprimé propre à 300 DPI est presque résolu. Une copie carbone faxée d'un formulaire manuscrit ne l'est pas.

Cette variabilité a une conséquence pratique que les gens sous-estiment : la sortie de l'OCR est une preuve de ce que la page dit probablement, pas une transcription fidèle. La recherche dans les archives OCRisées doit être considérée comme une aide à la récupération plutôt qu'une garantie, et tout ce qui a des conséquences juridiques doit être vérifié par rapport à la page rendue.

L'OCR nécessite également nettement plus de calcul que le rendu, ce qui explique pourquoi il s'agit généralement d'une opération par lots sur une archive plutôt que de quelque chose que vous lancez lorsqu'un utilisateur ouvre un fichier.

Dans Doconut

L'OCR est disponible uniquement via le plugin payant AdvancedSearch, et il n'est pas généralement disponible aujourd'hui — le moteur OCR est en cours de refonte. Ne planifiez pas autour de Doconut OCR, et ne le décrivez pas comme une capacité gratuite ou intégrée. Les documents qui arrivent sous forme de scans sont rendus correctement ; ils ne sont simplement pas recherchables.

Voir comment cela fonctionne en pratique

Les définitions ne vous mènent que jusqu'ici. Une licence temporaire s'exécute sur votre propre machine, avec vos propres documents.