OCR (reconocimiento óptico de caracteres)
Definición
Reconstruir texto legible por máquina a partir de una imagen de una página — la operación que le da a un documento escaneado la capa de texto que nunca tuvo.
OCR es un problema de reconocimiento, no de análisis, por lo que es probabilístico de una manera que el resto de la canalización del documento no es. La precisión depende de la resolución del escaneo, el contraste, la inclinación, el idioma, la tipografía y la complejidad del diseño. Texto impreso limpio a 300 DPI está casi resuelto. Una copia de fax de un formulario manuscrito no lo está.
Esa variabilidad tiene una consecuencia práctica que la gente subestima: la salida de OCR es evidencia de lo que probablemente dice una página, no una transcripción fiel. La búsqueda en archivos con OCR debe tratarse como una ayuda de recuperación más que como una garantía, y cualquier cosa con consecuencias legales debe verificarse contra la página renderizada.
OCR también requiere significativamente más cómputo que el renderizado, por lo que suele ser una operación por lotes sobre un archivo en lugar de algo que se ejecuta cuando un usuario abre un archivo.
En Doconut
OCR solo se ofrece a través del plugin de pago AdvancedSearch, y no está disponible de forma general hoy — el motor de OCR está siendo rebasado. No planifique alrededor de Doconut OCR, y no lo describa como una capacidad gratuita o incorporada. Los documentos que llegan como escaneos se renderizan correctamente; simplemente no son buscables.
Términos relacionados
Capa de texto
El texto legible por máquina almacenado dentro de un documento junto a su apariencia visual. Es lo que hace posible la búsqueda y la selección de texto, y es exactamente lo que una página escaneada no tiene.
Conversión de documentos
Transformar un archivo de un formato a otro y producir un nuevo archivo, a diferencia de la renderización, que produce una representación visual temporal y no un nuevo artefacto.