Lớp văn bản
Định nghĩa
Văn bản có thể đọc được bằng máy được lưu trữ trong tài liệu cùng với giao diện trực quan của nó. Đó là yếu tố cho phép tìm kiếm và lựa chọn văn bản, và chính xác là những gì một trang đã quét không có.
Một PDF sinh ra kỹ thuật số chứa cả bản vẽ của mỗi glyph và bản ghi về ký tự mà glyph đó đại diện. Tìm kiếm hoạt động vì thứ hai tồn tại. Một trang đã quét chỉ chứa hình ảnh — nhìn giống nhau, nhưng không có chức năng.
Đây là nguồn gây nhầm lẫn phổ biến nhất trong các dự án tìm kiếm tài liệu. "Tìm kiếm không hoạt động trên các tệp này" hầu như luôn có nghĩa là "các tệp này đã được quét", và không có mức độ tinh chỉnh nào của công cụ tìm kiếm có thể thay đổi điều đó. Giải pháp là OCR, một thao tác khác và tốn kém hơn đáng kể.
Các định dạng Office là trường hợp dễ dàng: một DOCX hoặc XLSX là văn bản có cấu trúc theo thiết kế, vì vậy lớp văn bản không bao giờ là vấn đề.
Trong Doconut
Tìm kiếm toàn văn chạy dựa trên lớp văn bản và được cung cấp bởi plugin AdvancedSearch trả phí. Nếu một tài liệu không có lớp văn bản, nó sẽ hiển thị đúng nhưng không trả về kết quả tìm kiếm nào.
Các thuật ngữ liên quan
OCR (nhận dạng ký tự quang học)
Tái tạo văn bản có thể đọc được bởi máy từ hình ảnh của một trang — thao tác cung cấp cho tài liệu đã quét lớp văn bản mà nó chưa bao giờ có.
Render tài liệu phía máy chủ
Chuyển đổi tài liệu thành hình ảnh các trang trên máy chủ, để trình duyệt hiển thị các trang đã được render thay vì tự phân tích tệp gốc.
Chuyển đổi tài liệu
Biến đổi một tệp từ định dạng này sang định dạng khác và tạo ra một tệp mới, khác với việc render, chỉ tạo ra một biểu diễn hình ảnh tạm thời và không có tài liệu mới.