Capa de texto

Definición

El texto legible por máquina almacenado dentro de un documento junto a su apariencia visual. Es lo que hace posible la búsqueda y la selección de texto, y es exactamente lo que una página escaneada no tiene.

Un PDF nacido digitalmente lleva tanto un dibujo de cada glifo como un registro de qué carácter representa ese glifo. La búsqueda funciona porque la segunda cosa existe. Una página escaneada solo lleva la imagen — visualmente idéntica, funcionalmente inerte.

Esta es la fuente única más común de confusión en proyectos de búsqueda de documentos. "La búsqueda no funciona en estos archivos" casi siempre significa "estos archivos fueron escaneados", y ninguna cantidad de ajuste del motor de búsqueda lo cambia. La solución es OCR, que es una operación diferente y considerablemente más costosa.

Los formatos de oficina son el caso fácil: un DOCX o un XLSX es texto estructurado por construcción, por lo que la capa de texto nunca está en cuestión.

En Doconut

La búsqueda de texto completo se ejecuta contra la capa de texto y es proporcionada por el plugin AdvancedSearch de pago. Si un documento no tiene capa de texto, se renderiza correctamente pero no devuelve resultados de búsqueda.

Ver cómo funciona en la práctica

Las definiciones solo te llevan hasta cierto punto. Una licencia temporal se ejecuta en tu propia máquina, contra tus propios documentos.