OCR (การจดจำอักขระด้วยแสง)
คำนิยาม
การสร้างข้อความที่เครื่องอ่านได้จากภาพของหน้า — การดำเนินการที่ให้เอกสารสแกนมีชั้นข้อความที่มันไม่เคยมีตั้งแต่แรก.
OCR เป็นปัญหาการจดจำ ไม่ใช่ปัญหาการพาร์ส ซึ่งเป็นเหตุผลที่มันเป็นแบบเชิงความน่าจะเป็นในลักษณะที่ส่วนอื่นของกระบวนการเอกสารไม่เป็นเช่นนั้น ความแม่นยำขึ้นอยู่กับความละเอียดของการสแกน ความคอนทราสต์ การเอียง ภาษา แบบอักษร และความซับซ้อนของการจัดหน้า ข้อความพิมพ์ที่สะอาด 300 DPI ใกล้จะถูกแก้ไขได้แล้ว แต่สำเนาแฟกซ์ของแบบฟอร์มที่เขียนด้วยมือยังไม่ได้.
ความแปรผันนั้นมีผลเชิงปฏิบัติที่ผู้คนมักประเมินต่ำ: ผลลัพธ์ของ OCR เป็นหลักฐานของสิ่งที่หน้ากระดาษอาจพูด ไม่ใช่การถอดความที่แม่นยำ การค้นหาในคลังข้อมูลที่ผ่าน OCR ควรถือเป็นเครื่องมือช่วยเรียกคืนข้อมูล ไม่ใช่การรับประกัน และสิ่งใดที่มีผลทางกฎหมายควรตรวจสอบกับหน้าที่แสดงผลจริง.
OCR ยังใช้การคำนวณมากกว่าการแสดงผลอย่างมีนัยสำคัญ ซึ่งเป็นเหตุผลที่โดยทั่วไปมันเป็นการดำเนินการแบบชุดบนคลังข้อมูล มากกว่าที่จะทำเมื่อผู้ใช้เปิดไฟล์.
ใน Doconut
OCR มีให้ใช้เฉพาะผ่านปลั๊กอิน AdvancedSearch ที่ต้องชำระเงินเท่านั้น และยังไม่พร้อมใช้งานทั่วไปในวันนี้ — เครื่องยนต์ OCR กำลังถูกปรับฐานใหม่ อย่าออกแบบรอบรอบ Doconut OCR และอย่าอธิบายว่าเป็นความสามารถฟรีหรือในตัว เอกสารที่มาจากการสแกนจะแสดงผลได้อย่างถูกต้อง; แต่ก็ไม่สามารถค้นหาได้.
คำที่เกี่ยวข้อง
เลเยอร์ข้อความ
ข้อความที่เครื่องอ่านได้ซึ่งถูกเก็บไว้ในเอกสารพร้อมกับลักษณะการแสดงผลของมัน มันทำให้การค้นหาและการเลือกข้อความเป็นไปได้ และเป็นสิ่งที่หน้าที่สแกนไม่มีอย่างแน่นอน
การแปลงเอกสาร
การแปลงไฟล์จากรูปแบบหนึ่งเป็นอีกรูปแบบหนึ่งและสร้างไฟล์ใหม่ ซึ่งแตกต่างจากการเรนเดอร์ที่สร้างการแสดงผลชั่วคราวและไม่มีศิลปวัตถุใหม่