Camada de texto

Definição

O texto legível por máquina armazenado dentro de um documento junto com sua aparência visual. É o que torna a pesquisa e a seleção de texto possíveis, e é exatamente o que uma página digitalizada não tem.

Um PDF nativo contém tanto o desenho de cada glifo quanto um registro de qual caractere esse glifo representa. A pesquisa funciona porque a segunda coisa existe. Uma página digitalizada contém apenas a imagem — visualmente idêntica, funcionalmente inerte.

Esta é a fonte única mais comum de confusão em projetos de pesquisa de documentos. "A pesquisa não funciona nesses arquivos" quase sempre significa "esses arquivos foram digitalizados", e nenhuma quantidade de ajuste no motor de busca altera isso. A solução é OCR, que é uma operação diferente e consideravelmente mais cara.

Os formatos de escritório são o caso fácil: um DOCX ou um XLSX é texto estruturado por construção, portanto a camada de texto nunca está em questão.

No Doconut

A pesquisa em texto completo funciona contra a camada de texto e é fornecida pelo plugin pago AdvancedSearch. Se um documento não tem camada de texto, ele é renderizado corretamente, mas não retorna resultados de pesquisa.

Veja como funciona na prática

As definições só levam você até certo ponto. Uma licença temporária roda na sua própria máquina, contra seus próprios documentos.