OCR (nhận dạng ký tự quang học)

Định nghĩa

Tái tạo văn bản có thể đọc được bởi máy từ hình ảnh của một trang — thao tác cung cấp cho tài liệu đã quét lớp văn bản mà nó chưa bao giờ có.

OCR là một vấn đề nhận dạng, không phải là vấn đề phân tích, vì vậy nó mang tính xác suất theo cách mà phần còn lại của quy trình tài liệu không có. Độ chính xác phụ thuộc vào độ phân giải quét, độ tương phản, độ nghiêng, ngôn ngữ, phông chữ và độ phức tạp của bố cục. Văn bản in sạch 300 DPI gần như đã được giải quyết. Một bản sao carbon fax của mẫu viết tay thì không.

Sự biến đổi đó có một hậu quả thực tế mà mọi người thường đánh giá thấp: kết quả OCR là bằng chứng về những gì một trang có thể nói, không phải là bản sao trung thực. Tìm kiếm trong các kho lưu trữ đã OCR nên được coi là công cụ hỗ trợ nhớ lại chứ không phải là bảo đảm, và bất kỳ điều gì có hậu quả pháp lý đều nên được xác minh so với trang đã hiển thị.

OCR cũng tiêu tốn đáng kể hơn nhiều tài nguyên tính toán so với việc hiển thị, vì vậy nó thường là một thao tác batch trên một kho lưu trữ chứ không phải là thứ bạn chạy khi người dùng mở một tệp.

Trong Doconut

OCR chỉ được cung cấp qua plugin AdvancedSearch trả phí, và hiện không có sẵn chung — engine OCR đang được tái cấu trúc. Đừng lên kế hoạch dựa trên Doconut OCR, và đừng mô tả nó như một khả năng miễn phí hoặc tích hợp sẵn. Các tài liệu đến dưới dạng quét sẽ được hiển thị đúng; chúng chỉ đơn giản là không thể tìm kiếm.

Xem cách nó hoạt động trong thực tế

Định nghĩa chỉ đưa bạn đến một mức độ nhất định. Giấy phép tạm thời chạy trên máy của bạn, với các tài liệu của bạn.