Camada de texto
Definição
O texto legível por máquina armazenado dentro de um documento junto com sua aparência visual. É o que torna a pesquisa e a seleção de texto possíveis, e é exatamente o que uma página digitalizada não tem.
Um PDF nativo contém tanto o desenho de cada glifo quanto um registro de qual caractere esse glifo representa. A pesquisa funciona porque a segunda coisa existe. Uma página digitalizada contém apenas a imagem — visualmente idêntica, funcionalmente inerte.
Esta é a fonte única mais comum de confusão em projetos de pesquisa de documentos. "A pesquisa não funciona nesses arquivos" quase sempre significa "esses arquivos foram digitalizados", e nenhuma quantidade de ajuste no motor de busca altera isso. A solução é OCR, que é uma operação diferente e consideravelmente mais cara.
Os formatos de escritório são o caso fácil: um DOCX ou um XLSX é texto estruturado por construção, portanto a camada de texto nunca está em questão.
No Doconut
A pesquisa em texto completo funciona contra a camada de texto e é fornecida pelo plugin pago AdvancedSearch. Se um documento não tem camada de texto, ele é renderizado corretamente, mas não retorna resultados de pesquisa.
Termos relacionados
OCR (reconhecimento óptico de caracteres)
Reconstituindo texto legível por máquina a partir de uma imagem de uma página — a operação que dá a um documento escaneado a camada de texto que nunca teve.
Renderização de documento no lado do servidor
Conversão de um documento em imagens de página no servidor, de modo que o navegador exibe páginas renderizadas em vez de analisar o próprio arquivo original.
Conversão de documentos
Transformar um arquivo de um formato para outro e produzir um novo arquivo, ao contrário da renderização, que produz uma representação visual temporária e nenhum novo artefato.