Текстовий шар

Визначення

Машиночитаємий текст, що зберігається в документі разом із його візуальним виглядом. Це те, що робить можливим пошук і виділення тексту, і саме чого не має сканована сторінка.

PDF, створений у цифровому форматі, містить як малюнок кожного гліфа, так і запис того, який символ цей гліф представляє. Пошук працює, бо існує друга складова. Сканована сторінка містить лише зображення — візуально ідентичне, функціонально бездіяльне.

Це найпоширеніше джерело плутанини в проектах пошуку документів. «Пошук не працює з цими файлами» майже завжди означає «ці файли були відскановані», і жодне налаштування пошукового движка цього не змінить. Вирішення — OCR, що є іншим і значно дорожчим процесом.

Офісні формати — це простий випадок: DOCX або XLSX за своєю природою є структурованим текстом, тому текстовий шар ніколи не ставиться під сумнів.

У Doconut

Повнотекстовий пошук працює по текстовому шару і надається платним плагіном AdvancedSearch. Якщо документ не має текстового шару, він відображається коректно, але не повертає результатів пошуку.

Подивіться, як це працює на практиці

Визначення лише частково допомагають. Тимчасова ліцензія працює на вашій машині, з вашими документами.