OCR (reconhecimento óptico de caracteres)
Definição
Reconstituindo texto legível por máquina a partir de uma imagem de uma página — a operação que dá a um documento escaneado a camada de texto que nunca teve.
OCR é um problema de reconhecimento, não de análise, o que explica por que ele é probabilístico de uma forma que o restante do fluxo de documentos não é. A precisão depende da resolução da digitalização, contraste, inclinação, idioma, tipografia e complexidade do layout. Texto impresso limpo em 300 DPI está quase resolvido. Uma cópia carbonada enviada por fax de um formulário manuscrito não está.
Essa variabilidade tem uma consequência prática que as pessoas subestimam: a saída do OCR é uma evidência do que uma página provavelmente diz, não uma transcrição fiel. A busca em arquivos com OCR deve ser tratada como um auxílio de recuperação, e não como uma garantia, e qualquer coisa com consequências legais deve ser verificada contra a página renderizada.
OCR também consome significativamente mais computação do que a renderização, o que explica por que geralmente é uma operação em lote sobre um arquivo, em vez de algo que você executa quando um usuário abre um arquivo.
No Doconut
OCR está disponível apenas através do plugin pago AdvancedSearch, e não está geralmente disponível hoje — o motor de OCR está sendo reestruturado. Não planeje em torno do Doconut OCR, e não o descreva como uma capacidade gratuita ou embutida. Documentos que chegam como digitalizações são renderizados corretamente; eles simplesmente não são pesquisáveis.