Текстовый слой
Определение
Машинно‑читаемый текст, хранящийся внутри документа вместе с его визуальным отображением. Он делает возможным поиск и выделение текста, и именно этого не имеет сканированная страница.
Созданный в цифровом виде PDF содержит как рисунок каждого глифа, так и запись того, какой символ этот глиф представляет. Поиск работает, потому что существует второе. Сканированная страница содержит только изображение — визуально идентичное, но функционально безжизненное.
Это самая распространённая причина путаницы в проектах поиска по документам. «Поиск не работает в этих файлах» почти всегда означает «эти файлы отсканированы», и никакая настройка поискового движка этого не изменит. Решение — OCR, что является отдельной и значительно более дорогой операцией.
Офисные форматы — простой случай: DOCX или XLSX по своей природе являются структурированным текстом, поэтому наличие текстового слоя никогда не ставится под вопрос.
В Doconut
Полнотекстовый поиск работает по текстовому слою и предоставляется платным плагином AdvancedSearch. Если у документа нет текстового слоя, он отображается корректно, но не возвращает результаты поиска.