OCR (تشخیص نوری کاراکتر)
تعریف
بازسازی متن قابل خواندن توسط ماشین از تصویر یک صفحه — عملی که لایه متنی را به سند اسکنشده میدهد که هرگز وجود نداشته است.
OCR یک مشکل شناسایی است، نه یک مشکل تجزیه، به همین دلیل به صورت احتمالی عمل میکند در حالی که بقیهٔ خط لولهٔ سند اینگونه نیست. دقت به وضوح اسکن، کنتراست، انحراف، زبان، نوع قلم و پیچیدگی چیدمان بستگی دارد. متن چاپی تمیز با ۳۰۰ DPI تقریباً حل شده است. یک کپی فکس شدهٔ کربنی از فرم دستنویس چنین نیست.
این تغییرپذیری پیامد عملی دارد که مردم آن را دستکم میگیرند: خروجی OCR شواهدی است از آنچه صفحه احتمالاً میگوید، نه یک نسخهٔ دقیق. جستجو در آرشیوهای OCR‑شده باید به عنوان یک ابزار یادآوری در نظر گرفته شود نه یک تضمین، و هر چیزی که پیامدهای قانونی دارد باید در برابر صفحهٔ رندر شده تأیید شود.
OCR همچنین به مقدار قابلتوجهی محاسبه بیشتری نسبت به رندر کردن نیاز دارد، به همین دلیل معمولاً یک عملیات دستهای بر روی آرشیو است نه چیزی که هنگام باز کردن فایل توسط کاربر اجرا کنید.
در Doconut
OCR فقط از طریق افزونهٔ پرداختی AdvancedSearch ارائه میشود و امروز بهطور عمومی در دسترس نیست — موتور OCR در حال بازسازی است. برنامهریزی بر پایهٔ OCR Doconut نکنید و آن را بهعنوان قابلیت رایگان یا داخلی توصیف نکنید. اسنادی که بهصورت اسکن میآیند بهدرستی رندر میشوند؛ اما بهسادگی قابل جستجو نیستند.