OCR (riconoscimento ottico dei caratteri)

Definizione

Ricostruire testo leggibile da una macchina a partire da un'immagine di una pagina — l'operazione che conferisce a un documento scansionato lo strato di testo che non ha mai avuto.

OCR è un problema di riconoscimento, non di parsing, ed è per questo che è probabilistico in un modo in cui il resto della pipeline del documento non lo è. La precisione dipende dalla risoluzione della scansione, dal contrasto, dall'inclinazione, dalla lingua, dal tipo di carattere e dalla complessità del layout. Un testo stampato pulito a 300 DPI è quasi risolto. Una copia carbone faxata di un modulo scritto a mano non lo è.

Quella variabilità ha una conseguenza pratica che le persone sottovalutano: l'output di OCR è una prova di ciò che una pagina probabilmente dice, non una trascrizione fedele. La ricerca negli archivi OCRizzati dovrebbe essere considerata come un aiuto al richiamo piuttosto che una garanzia, e qualsiasi cosa con conseguenze legali dovrebbe essere verificata rispetto alla pagina renderizzata.

OCR richiede anche significativamente più potenza di calcolo rispetto al rendering, ed è per questo che di solito è un'operazione batch su un archivio piuttosto che qualcosa che esegui quando un utente apre un file.

In Doconut

OCR è disponibile solo tramite il plugin a pagamento AdvancedSearch, e non è generalmente disponibile oggi — il motore OCR è in fase di ricostruzione. Non pianificare intorno a Doconut OCR, e non descriverlo come una funzionalità gratuita o integrata. I documenti che arrivano come scansioni vengono renderizzati correttamente; semplicemente non sono ricercabili.

Vedi come funziona nella pratica

Le definizioni ti portano solo fino a un certo punto. Una licenza temporanea gira sulla tua macchina, sui tuoi documenti.