Текстовий шар
Визначення
Машиночитаємий текст, що зберігається в документі разом із його візуальним виглядом. Це те, що робить можливим пошук і виділення тексту, і саме чого не має сканована сторінка.
PDF, створений у цифровому форматі, містить як малюнок кожного гліфа, так і запис того, який символ цей гліф представляє. Пошук працює, бо існує друга складова. Сканована сторінка містить лише зображення — візуально ідентичне, функціонально бездіяльне.
Це найпоширеніше джерело плутанини в проектах пошуку документів. «Пошук не працює з цими файлами» майже завжди означає «ці файли були відскановані», і жодне налаштування пошукового движка цього не змінить. Вирішення — OCR, що є іншим і значно дорожчим процесом.
Офісні формати — це простий випадок: DOCX або XLSX за своєю природою є структурованим текстом, тому текстовий шар ніколи не ставиться під сумнів.
У Doconut
Повнотекстовий пошук працює по текстовому шару і надається платним плагіном AdvancedSearch. Якщо документ не має текстового шару, він відображається коректно, але не повертає результатів пошуку.