OCR (การจดจำอักขระด้วยแสง)

คำนิยาม

การสร้างข้อความที่เครื่องอ่านได้จากภาพของหน้า — การดำเนินการที่ให้เอกสารสแกนมีชั้นข้อความที่มันไม่เคยมีตั้งแต่แรก.

OCR เป็นปัญหาการจดจำ ไม่ใช่ปัญหาการพาร์ส ซึ่งเป็นเหตุผลที่มันเป็นแบบเชิงความน่าจะเป็นในลักษณะที่ส่วนอื่นของกระบวนการเอกสารไม่เป็นเช่นนั้น ความแม่นยำขึ้นอยู่กับความละเอียดของการสแกน ความคอนทราสต์ การเอียง ภาษา แบบอักษร และความซับซ้อนของการจัดหน้า ข้อความพิมพ์ที่สะอาด 300 DPI ใกล้จะถูกแก้ไขได้แล้ว แต่สำเนาแฟกซ์ของแบบฟอร์มที่เขียนด้วยมือยังไม่ได้.

ความแปรผันนั้นมีผลเชิงปฏิบัติที่ผู้คนมักประเมินต่ำ: ผลลัพธ์ของ OCR เป็นหลักฐานของสิ่งที่หน้ากระดาษอาจพูด ไม่ใช่การถอดความที่แม่นยำ การค้นหาในคลังข้อมูลที่ผ่าน OCR ควรถือเป็นเครื่องมือช่วยเรียกคืนข้อมูล ไม่ใช่การรับประกัน และสิ่งใดที่มีผลทางกฎหมายควรตรวจสอบกับหน้าที่แสดงผลจริง.

OCR ยังใช้การคำนวณมากกว่าการแสดงผลอย่างมีนัยสำคัญ ซึ่งเป็นเหตุผลที่โดยทั่วไปมันเป็นการดำเนินการแบบชุดบนคลังข้อมูล มากกว่าที่จะทำเมื่อผู้ใช้เปิดไฟล์.

ใน Doconut

OCR มีให้ใช้เฉพาะผ่านปลั๊กอิน AdvancedSearch ที่ต้องชำระเงินเท่านั้น และยังไม่พร้อมใช้งานทั่วไปในวันนี้ — เครื่องยนต์ OCR กำลังถูกปรับฐานใหม่ อย่าออกแบบรอบรอบ Doconut OCR และอย่าอธิบายว่าเป็นความสามารถฟรีหรือในตัว เอกสารที่มาจากการสแกนจะแสดงผลได้อย่างถูกต้อง; แต่ก็ไม่สามารถค้นหาได้.

ดูว่ามันทำงานอย่างไรในทางปฏิบัติ

คำนิยามเพียงอย่างเดียวไม่พอ ใบอนุญาตชั่วคราวทำงานบนเครื่องของคุณเอง กับเอกสารของคุณเอง.