OCR (광학 문자 인식)
정의
페이지 이미지에서 기계가 읽을 수 있는 텍스트를 재구성하는 것 — 스캔된 문서에 원래 없던 텍스트 레이어를 부여하는 작업.
OCR은 인식 문제이며, 구문 분석 문제는 아닙니다. 그래서 문서 파이프라인의 다른 부분과 달리 확률적입니다. 정확도는 스캔 해상도, 대비, 기울기, 언어, 서체 및 레이아웃 복잡도에 따라 달라집니다. 깨끗한 300 DPI 인쇄 텍스트는 거의 해결되었습니다. 손글씨 양식의 팩스 복사본은 그렇지 않습니다.
그 변동성은 사람들이 과소평가하는 실질적인 결과를 초래합니다: OCR 출력은 페이지가 아마도 말하는 내용에 대한 증거일 뿐, 정확한 전사가 아닙니다. OCR 처리된 아카이브 검색은 보증이라기보다 회수 보조 수단으로 취급해야 하며, 법적 효력이 있는 모든 내용은 렌더링된 페이지와 대조하여 확인해야 합니다.
OCR은 렌더링보다 훨씬 더 많은 연산 자원을 필요로 하므로, 일반적으로 사용자가 파일을 열 때 실행하는 것이 아니라 아카이브에 대해 배치 작업으로 수행됩니다.
Doconut에서
OCR은 유료 AdvancedSearch 플러그인을 통해서만 제공되며 현재 일반적으로 사용할 수 없습니다 — OCR 엔진이 재구축 중입니다. Doconut OCR을 기반으로 계획하지 말고, 이를 무료 또는 내장 기능이라고 설명하지 마십시오. 스캔으로 들어오는 문서는 올바르게 렌더링되지만 검색할 수는 없습니다.