OCR (οπτική αναγνώριση χαρακτήρων)

Ορισμός

Αναδημιουργία κειμένου αναγνώσιμου από μηχανή από μια εικόνα σελίδας — η λειτουργία που προσθέτει σε ένα σαρωμένο έγγραφο τη στρώση κειμένου που δεν είχε ποτέ.

Το OCR είναι ένα πρόβλημα αναγνώρισης, όχι ένα πρόβλημα ανάλυσης, γι' αυτό είναι πιθανοκρατικό με τρόπο που δεν είναι το υπόλοιπο της ροής εργασίας του εγγράφου.

Η ακρίβεια εξαρτάται από την ανάλυση σάρωσης, την αντίθεση, την κλίση, τη γλώσσα, τη γραμματοσειρά και την πολυπλοκότητα διάταξης. Το καθαρό εκτυπωμένο κείμενο 300 DPI είναι σχεδόν επιλυμένο. Ένα φαξαρισμένο αντίγραφο ενός χειρόγραφου εντύπου δεν είναι.

Αυτή η μεταβλητότητα έχει μια πρακτική συνέπεια που οι άνθρωποι υποτιμούν: η έξοδος του OCR είναι απόδειξη του τι πιθανότατα λέει μια σελίδα, όχι μια πιστή απομαγνητογράφηση. Η αναζήτηση σε αρχεία με OCR πρέπει να θεωρείται ως βοήθεια ανάκλησης και όχι ως εγγύηση, και οτιδήποτε έχει νομικές συνέπειες πρέπει να επαληθευτεί με τη δοσμένη σελίδα.

Το OCR επίσης απαιτεί σημαντικά περισσότερους υπολογιστικούς πόρους από την απόδοση, γι' αυτό συνήθως είναι μια λειτουργία σε παρτίδες πάνω σε ένα αρχείο αντί για κάτι που εκτελείται όταν ένας χρήστης ανοίγει ένα αρχείο.

Στο Doconut

Το OCR διατίθεται μόνο μέσω του επί πληρωμή πρόσθετου Προηγμένης Αναζήτησης, και δεν είναι γενικά διαθέσιμο σήμερα — η μηχανή OCR επανασχεδιάζεται. Μην σχεδιάζετε γύρω από το Doconut OCR, και μην το περιγράφετε ως δωρεάν ή ενσωματωμένη δυνατότητα. Τα έγγραφα που φτάνουν ως σαρώσεις αποδίδονται σωστά· απλώς δεν είναι αναζητήσιμα.

Δείτε πώς λειτουργεί στην πράξη

Οι ορισμοί σας οδηγούν μόνο μέχρι ένα σημείο. Μια προσωρινή άδεια λειτουργεί στον δικό σας υπολογιστή, με τα δικά σας έγγραφα.