Warstwa tekstowa
Definicja
Tekst czytelny dla maszyn, przechowywany w dokumencie wraz z jego wyglądem wizualnym. To on umożliwia wyszukiwanie i zaznaczanie tekstu, a dokładnie tego nie ma zeskanowana strona.
PDF powstały w formie cyfrowej zawiera zarówno rysunek każdego glifu, jak i zapis, jaki znak ten glif reprezentuje. Wyszukiwanie działa, ponieważ istnieje ta druga rzecz. Zeskanowana strona zawiera jedynie obraz — wizualnie identyczny, ale funkcjonalnie nieaktywny.
To najczęstsze źródło zamieszania w projektach wyszukiwania w dokumentach. „Wyszukiwanie nie działa w tych plikach” prawie zawsze oznacza „te pliki zostały zeskanowane”, i żadne dostrajanie silnika wyszukiwania tego nie zmieni. Rozwiązaniem jest OCR, które jest inną i znacznie droższą operacją.
Formaty biurowe to prosty przypadek: DOCX lub XLSX to z natury tekst strukturalny, więc warstwa tekstowa nigdy nie jest problemem.
W Doconut
Wyszukiwanie pełnotekstowe działa na warstwie tekstowej i jest zapewniane przez płatną wtyczkę AdvancedSearch. Jeśli dokument nie ma warstwy tekstowej, jest poprawnie renderowany, ale nie zwraca wyników wyszukiwania.
Powiązane terminy
OCR (optyczne rozpoznawanie znaków)
Odtwarzanie tekstu czytelnego dla maszyn z obrazu strony — operacja, która nadaje zeskanowanemu dokumentowi warstwę tekstową, której nigdy nie miał.
Renderowanie dokumentu po stronie serwera
Konwertowanie dokumentu na obrazy stron na serwerze, dzięki czemu przeglądarka wyświetla wyrenderowane strony zamiast parsować sam oryginalny plik.
Konwersja dokumentów
Przekształcanie pliku z jednego formatu na inny i tworzenie nowego pliku, w odróżnieniu od renderowania, które tworzy tymczasową wizualną reprezentację i nie generuje nowego artefaktu.