שכבת טקסט

הגדרה

הטקסט הקריא למכונה השמור בתוך מסמך לצד המראה הוויזואלי שלו. הוא מה שמאפשר חיפוש ובחירת טקסט, והוא בדיוק מה שדף סרוק אינו מכיל.

קובץ PDF שנוצר דיגיטלית מכיל גם ציור של כל גליף וגם רישום של האות שהגליף מייצג. החיפוש עובד מכיוון שהדבר השני קיים. דף סרוק מכיל רק את התמונה — זהה ויזואלית, אך תפקודית חסרת תועלת.

זהו המקור השגור ביותר לבלבול בפרויקטי חיפוש מסמכים. "החיפוש אינו עובד בקבצים אלה" כמעט תמיד משמעותו "הקבצים סורקו", ואין כמות של כיוונון של מנוע החיפוש שמשנה זאת. הפתרון הוא OCR, שהוא פעולה שונה ויקרה בהרבה.

פורמטים של Office הם המקרה הפשוט: קובץ DOCX או XLSX הוא טקסט מובנה מטבעו, ולכן שכבת הטקסט אינה נושא לדיון.

ב-Doconut

חיפוש טקסט מלא פועל נגד שכבת הטקסט ומסופק על ידי תוסף AdvancedSearch בתשלום. אם למסמך אין שכבת טקסט, הוא מוצג כראוי אך לא מחזיר תוצאות חיפוש.

ראה איך זה עובד בפועל

הגדרות רק מביאות אותך עד כאן. רישיון זמני פועל במחשב שלך, על המסמכים שלך.