OCR (التعرف الضوئي على الأحرف)

التعريف

إعادة بناء نص قابل للقراءة آليًا من صورة صفحة — العملية التي تضيف طبقة نصية إلى المستند الممسوح ضوئيًا لم يولد بها أصلاً.

OCR هو مشكلة التعرف، وليس مشكلة التحليل، وهذا هو السبب في أنه احتمالي بطريقة لا تكون فيها بقية خط أنابيب المستند كذلك. تعتمد الدقة على دقة المسح، التباين، الانحراف، اللغة، الخط وتعقيد التخطيط. النص المطبوع النظيف بدقة 300 DPI قريب من الحل. نسخة فاكسميل من نموذج مكتوب يدويًا ليست كذلك.

تلك التباينات لها عواقب عملية يقلل الناس من شأنها: مخرجات OCR هي دليل على ما قد تقول الصفحة، وليس نسخة دقيقة. يجب اعتبار البحث في الأرشيفات التي تم تطبيق OCR عليها كأداة استدعاء وليس كضمان، وأي شيء له تبعات قانونية يجب التحقق منه مقابل الصفحة المعروضة.

كما أن OCR يتطلب حسابًا أكثر بكثير من عملية العرض، وهذا هو السبب في أنه عادةً ما يكون عملية دفعة على الأرشيف بدلاً من شيء تشغله عندما يفتح المستخدم ملفًا.

في Doconut

يتم توفير OCR فقط عبر إضافة AdvancedSearch المدفوعة، ولا يتوفر بشكل عام اليوم — يتم إعادة بناء محرك OCR. لا تخطط حول OCR في Doconut، ولا تصفه كميزة مجانية أو مدمجة. المستندات التي تصل كمسحات ضوئية تُعرض بشكل صحيح؛ لكنها ببساطة غير قابلة للبحث.

شاهد كيف يعمل عمليًا

التعريفات لا تأخذك بعيدًا. ترخيص مؤقت يعمل على جهازك الخاص، ضد مستنداتك الخاصة.