שכבת טקסט
הגדרה
הטקסט הקריא למכונה השמור בתוך מסמך לצד המראה הוויזואלי שלו. הוא מה שמאפשר חיפוש ובחירת טקסט, והוא בדיוק מה שדף סרוק אינו מכיל.
קובץ PDF שנוצר דיגיטלית מכיל גם ציור של כל גליף וגם רישום של האות שהגליף מייצג. החיפוש עובד מכיוון שהדבר השני קיים. דף סרוק מכיל רק את התמונה — זהה ויזואלית, אך תפקודית חסרת תועלת.
זהו המקור השגור ביותר לבלבול בפרויקטי חיפוש מסמכים. "החיפוש אינו עובד בקבצים אלה" כמעט תמיד משמעותו "הקבצים סורקו", ואין כמות של כיוונון של מנוע החיפוש שמשנה זאת. הפתרון הוא OCR, שהוא פעולה שונה ויקרה בהרבה.
פורמטים של Office הם המקרה הפשוט: קובץ DOCX או XLSX הוא טקסט מובנה מטבעו, ולכן שכבת הטקסט אינה נושא לדיון.
ב-Doconut
חיפוש טקסט מלא פועל נגד שכבת הטקסט ומסופק על ידי תוסף AdvancedSearch בתשלום. אם למסמך אין שכבת טקסט, הוא מוצג כראוי אך לא מחזיר תוצאות חיפוש.
מונחים קשורים
OCR (זיהוי תווים אופטי)
שחזור טקסט קריא למכונה מתמונה של דף — הפעולה שנותנת למסמך סרוק שכבת טקסט שמעולם לא הייתה קיימת.
רינדור מסמך בצד השרת
המרת מסמך לתמונות עמודים על השרת, כך שהדפדפן מציג עמודים מרונדרים במקום לנתח את הקובץ המקורי עצמו.
המרת מסמכים
המרת קובץ מפורמט אחד לאחר ויצירת קובץ חדש, בניגוד להצגה, שמייצרת ייצוג חזותי זמני ואין לה תוצר חדש.