OCR (تشخیص نوری کاراکتر)

تعریف

بازسازی متن قابل خواندن توسط ماشین از تصویر یک صفحه — عملی که لایه متنی را به سند اسکن‌شده می‌دهد که هرگز وجود نداشته است.

OCR یک مشکل شناسایی است، نه یک مشکل تجزیه، به همین دلیل به صورت احتمالی عمل می‌کند در حالی که بقیهٔ خط لولهٔ سند این‌گونه نیست. دقت به وضوح اسکن، کنتراست، انحراف، زبان، نوع قلم و پیچیدگی چیدمان بستگی دارد. متن چاپی تمیز با ۳۰۰ DPI تقریباً حل شده است. یک کپی فکس‌ شدهٔ کربنی از فرم دست‌نویس چنین نیست.

این تغییرپذیری پیامد عملی دارد که مردم آن را دست‌کم می‌گیرند: خروجی OCR شواهدی است از آنچه صفحه احتمالاً می‌گوید، نه یک نسخهٔ دقیق. جستجو در آرشیوهای OCR‑شده باید به عنوان یک ابزار یادآوری در نظر گرفته شود نه یک تضمین، و هر چیزی که پیامدهای قانونی دارد باید در برابر صفحهٔ رندر شده تأیید شود.

OCR همچنین به مقدار قابل‌توجهی محاسبه بیشتری نسبت به رندر کردن نیاز دارد، به همین دلیل معمولاً یک عملیات دسته‌ای بر روی آرشیو است نه چیزی که هنگام باز کردن فایل توسط کاربر اجرا کنید.

در Doconut

OCR فقط از طریق افزونهٔ پرداختی AdvancedSearch ارائه می‌شود و امروز به‌طور عمومی در دسترس نیست — موتور OCR در حال بازسازی است. برنامه‌ریزی بر پایهٔ OCR Doconut نکنید و آن را به‌عنوان قابلیت رایگان یا داخلی توصیف نکنید. اسنادی که به‌صورت اسکن می‌آیند به‌درستی رندر می‌شوند؛ اما به‌سادگی قابل جستجو نیستند.

ببینید چگونه در عمل کار می‌کند

تعاریف فقط تا این حد شما را همراهی می‌کنند. یک مجوز موقت بر روی ماشین خودتان اجرا می‌شود، بر روی اسناد خودتان.