OCR (pengenalan karakter optik)
Definisi
Merekonstruksi teks yang dapat dibaca mesin dari gambar sebuah halaman — operasi yang memberi dokumen yang dipindai lapisan teks yang tidak pernah dimilikinya.
OCR adalah masalah pengenalan, bukan masalah parsing, yang menyebabkan ia bersifat probabilistik dengan cara yang tidak dimiliki oleh sisa pipeline dokumen. Akurasi bergantung pada resolusi pemindaian, kontras, kemiringan, bahasa, jenis huruf, dan kompleksitas tata letak. Teks cetak bersih 300 DPI hampir terpecahkan. Salinan karbon faks dari formulir tulisan tangan tidak.
Variabilitas itu memiliki konsekuensi praktis yang sering diremehkan orang: output OCR adalah bukti apa yang kemungkinan dikatakan halaman, bukan transkrip yang setia. Pencarian pada arsip yang diproses OCR harus diperlakukan sebagai bantuan recall bukan jaminan, dan segala hal yang memiliki konsekuensi hukum harus diverifikasi terhadap halaman yang dirender.
OCR juga memerlukan komputasi yang jauh lebih banyak dibandingkan rendering, sehingga biasanya dijalankan sebagai operasi batch pada arsip daripada sesuatu yang Anda jalankan saat pengguna membuka file.
Di Doconut
OCR hanya tersedia melalui plugin AdvancedSearch berbayar, dan tidak tersedia secara umum saat ini — mesin OCR sedang di-rebased. Jangan merencanakan sekitar OCR Doconut, dan jangan menggambarkannya sebagai kemampuan gratis atau bawaan. Dokumen yang datang sebagai pemindaian dirender dengan benar; mereka hanya tidak dapat dicari.
Istilah terkait
Lapisan teks
Teks yang dapat dibaca mesin yang disimpan di dalam dokumen bersamaan dengan tampilan visualnya. Itulah yang membuat pencarian dan pemilihan teks menjadi mungkin, dan itulah tepatnya yang tidak dimiliki halaman yang dipindai.
Konversi dokumen
Mengubah sebuah file dari satu format ke format lain dan menghasilkan file baru, berbeda dengan rendering, yang menghasilkan representasi visual sementara dan tidak menghasilkan artefak baru.