OCR (זיהוי תווים אופטי)

הגדרה

שחזור טקסט קריא למכונה מתמונה של דף — הפעולה שנותנת למסמך סרוק שכבת טקסט שמעולם לא הייתה קיימת.

OCR הוא בעיית זיהוי, לא בעיית ניתוח, ולכן הוא הסתברותי באופן שהשאר בצינור המסמכים אינו. הדיוק תלוי ברזולוציית הסריקה, בניגודיות, בהטייה, בשפה, בגופן ובמורכבות הפריסה. טקסט מודפס נקי ברזולוציית 300 DPI קרוב לפתרון. העתק פקס של טופס בכתב יד אינו.

המשתנות הזו נושאת תוצאה מעשית שאנשים מזלזלים בה: פלט OCR הוא עדות למה שהדף כנראה אומר, ולא תמליל מדויק. חיפוש בארכיונים שעברו OCR צריך להיחשב ככלי סיוע לזיכרון ולא כהבטחה, וכל דבר בעל השלכות משפטיות צריך להיבדק מול הדף המוצג.

OCR גם דורש משאבי חישוב משמעותית יותר מאשר רינדור, ולכן הוא בדרך כלל פעולה באצווה על ארכיון ולא משהו שמופעל כאשר משתמש פותח קובץ.

ב-Doconut

OCR משולב רק דרך תוסף AdvancedSearch בתשלום, והוא אינו זמין באופן כללי היום — מנוע OCR נמצא בתהליך שינוי בסיס. אל תתכננו סביב OCR של Doconut, ואל תתארו זאת כיכולת חינמית או מובנית. מסמכים שמגיעים כסריקות מוצגים כראוי; הם פשוט אינם ניתנים לחיפוש.

ראה איך זה עובד בפועל

הגדרות רק מביאות אותך עד כאן. רישיון זמני פועל במחשב שלך, על המסמכים שלך.