OCR (nhận dạng ký tự quang học)
Định nghĩa
Tái tạo văn bản có thể đọc được bởi máy từ hình ảnh của một trang — thao tác cung cấp cho tài liệu đã quét lớp văn bản mà nó chưa bao giờ có.
OCR là một vấn đề nhận dạng, không phải là vấn đề phân tích, vì vậy nó mang tính xác suất theo cách mà phần còn lại của quy trình tài liệu không có. Độ chính xác phụ thuộc vào độ phân giải quét, độ tương phản, độ nghiêng, ngôn ngữ, phông chữ và độ phức tạp của bố cục. Văn bản in sạch 300 DPI gần như đã được giải quyết. Một bản sao carbon fax của mẫu viết tay thì không.
Sự biến đổi đó có một hậu quả thực tế mà mọi người thường đánh giá thấp: kết quả OCR là bằng chứng về những gì một trang có thể nói, không phải là bản sao trung thực. Tìm kiếm trong các kho lưu trữ đã OCR nên được coi là công cụ hỗ trợ nhớ lại chứ không phải là bảo đảm, và bất kỳ điều gì có hậu quả pháp lý đều nên được xác minh so với trang đã hiển thị.
OCR cũng tiêu tốn đáng kể hơn nhiều tài nguyên tính toán so với việc hiển thị, vì vậy nó thường là một thao tác batch trên một kho lưu trữ chứ không phải là thứ bạn chạy khi người dùng mở một tệp.
Trong Doconut
OCR chỉ được cung cấp qua plugin AdvancedSearch trả phí, và hiện không có sẵn chung — engine OCR đang được tái cấu trúc. Đừng lên kế hoạch dựa trên Doconut OCR, và đừng mô tả nó như một khả năng miễn phí hoặc tích hợp sẵn. Các tài liệu đến dưới dạng quét sẽ được hiển thị đúng; chúng chỉ đơn giản là không thể tìm kiếm.
Các thuật ngữ liên quan
Lớp văn bản
Văn bản có thể đọc được bằng máy được lưu trữ trong tài liệu cùng với giao diện trực quan của nó. Đó là yếu tố cho phép tìm kiếm và lựa chọn văn bản, và chính xác là những gì một trang đã quét không có.
Chuyển đổi tài liệu
Biến đổi một tệp từ định dạng này sang định dạng khác và tạo ra một tệp mới, khác với việc render, chỉ tạo ra một biểu diễn hình ảnh tạm thời và không có tài liệu mới.