OCR (reconocimiento óptico de caracteres)

Definición

Reconstruir texto legible por máquina a partir de una imagen de una página — la operación que le da a un documento escaneado la capa de texto que nunca tuvo.

OCR es un problema de reconocimiento, no de análisis, por lo que es probabilístico de una manera que el resto de la canalización del documento no es. La precisión depende de la resolución del escaneo, el contraste, la inclinación, el idioma, la tipografía y la complejidad del diseño. Texto impreso limpio a 300 DPI está casi resuelto. Una copia de fax de un formulario manuscrito no lo está.

Esa variabilidad tiene una consecuencia práctica que la gente subestima: la salida de OCR es evidencia de lo que probablemente dice una página, no una transcripción fiel. La búsqueda en archivos con OCR debe tratarse como una ayuda de recuperación más que como una garantía, y cualquier cosa con consecuencias legales debe verificarse contra la página renderizada.

OCR también requiere significativamente más cómputo que el renderizado, por lo que suele ser una operación por lotes sobre un archivo en lugar de algo que se ejecuta cuando un usuario abre un archivo.

En Doconut

OCR solo se ofrece a través del plugin de pago AdvancedSearch, y no está disponible de forma general hoy — el motor de OCR está siendo rebasado. No planifique alrededor de Doconut OCR, y no lo describa como una capacidad gratuita o incorporada. Los documentos que llegan como escaneos se renderizan correctamente; simplemente no son buscables.

Ver cómo funciona en la práctica

Las definiciones solo te llevan hasta cierto punto. Una licencia temporal se ejecuta en tu propia máquina, contra tus propios documentos.