OCR (optik karakter tanıma)

Tanım

Bir sayfanın görüntüsünden makine tarafından okunabilir metni yeniden oluşturma — taranmış bir belgeye asla doğmadığı metin katmanını veren işlem.

OCR, bir tanıma sorunudur, ayrıştırma sorunu değildir, bu yüzden belge iş akışının geri kalanının olmadığı bir şekilde olasılıksaldır. Doğruluk, tarama çözünürlüğü, kontrast, eğiklik, dil, yazı tipi ve düzen karmaşıklığına bağlıdır. Temiz 300 DPI baskılı metin neredeyse çözülmüştür. El yazısı bir formun faksla gönderilen karbon kopyası ise değildir.

Bu değişkenliğin insanlar tarafından küçümsenen pratik bir sonucu vardır: OCR çıktısı, bir sayfanın muhtemelen ne söylediğinin kanıtıdır, sadık bir transkript değildir. OCR'lu arşivlerde arama, bir garanti yerine hatırlama yardımı olarak ele alınmalıdır ve yasal olarak sonuç doğurabilecek her şey, oluşturulan sayfaya karşı doğrulanmalıdır.

OCR ayrıca, render etmeden çok daha fazla işlem gücü gerektirir, bu yüzden genellikle bir dosya açıldığında çalıştırdığınız bir şey yerine bir arşiv üzerinde toplu bir işlem olarak yürütülür.

Doconut'ta

OCR yalnızca ücretli AdvancedSearch eklentisi aracılığıyla sunulur ve bugün genel olarak mevcut değildir — OCR motoru yeniden temellendiriliyor. Doconut OCR'ye göre plan yapmayın ve onu ücretsiz ya da yerleşik bir özellik olarak tanımlamayın. Tarama olarak gelen belgeler doğru şekilde render edilir; sadece aranabilir değildir.

Uygulamada nasıl çalıştığını görün

Tanımlar sadece sizi bu kadar ileri götürür. Geçici bir lisans kendi makinenizde, kendi belgelerinizle çalışır.