Текстовый слой

Определение

Машинно‑читаемый текст, хранящийся внутри документа вместе с его визуальным отображением. Он делает возможным поиск и выделение текста, и именно этого не имеет сканированная страница.

Созданный в цифровом виде PDF содержит как рисунок каждого глифа, так и запись того, какой символ этот глиф представляет. Поиск работает, потому что существует второе. Сканированная страница содержит только изображение — визуально идентичное, но функционально безжизненное.

Это самая распространённая причина путаницы в проектах поиска по документам. «Поиск не работает в этих файлах» почти всегда означает «эти файлы отсканированы», и никакая настройка поискового движка этого не изменит. Решение — OCR, что является отдельной и значительно более дорогой операцией.

Офисные форматы — простой случай: DOCX или XLSX по своей природе являются структурированным текстом, поэтому наличие текстового слоя никогда не ставится под вопрос.

В Doconut

Полнотекстовый поиск работает по текстовому слою и предоставляется платным плагином AdvancedSearch. Если у документа нет текстового слоя, он отображается корректно, но не возвращает результаты поиска.

Посмотрите, как это работает на практике

Определения могут лишь отчасти помочь. Временная лицензия работает на вашем компьютере, с вашими документами.