Lapisan teks
Definisi
Teks yang dapat dibaca mesin yang disimpan di dalam dokumen bersamaan dengan tampilan visualnya. Itulah yang membuat pencarian dan pemilihan teks menjadi mungkin, dan itulah tepatnya yang tidak dimiliki halaman yang dipindai.
PDF yang dibuat secara digital menyimpan baik gambar setiap glyph maupun catatan karakter yang diwakili glyph tersebut. Pencarian berfungsi karena hal kedua ada. Halaman yang dipindai hanya menyimpan gambar — secara visual identik, namun secara fungsional tidak aktif.
Ini adalah sumber kebingungan paling umum dalam proyek pencarian dokumen. "Pencarian tidak berfungsi pada file ini" hampir selalu berarti "file ini dipindai", dan tidak ada penyesuaian mesin pencari yang dapat mengubah hal itu. Solusinya adalah OCR, yang merupakan operasi berbeda dan jauh lebih mahal.
Format kantor adalah kasus yang mudah: DOCX atau XLSX secara struktural merupakan teks, sehingga lapisan teks tidak pernah menjadi pertanyaan.
Di Doconut
Pencarian teks penuh berjalan pada lapisan teks dan disediakan oleh plugin AdvancedSearch berbayar. Jika sebuah dokumen tidak memiliki lapisan teks, dokumen akan ditampilkan dengan benar namun tidak menghasilkan hasil pencarian.
Istilah terkait
OCR (pengenalan karakter optik)
Merekonstruksi teks yang dapat dibaca mesin dari gambar sebuah halaman — operasi yang memberi dokumen yang dipindai lapisan teks yang tidak pernah dimilikinya.
Rendering dokumen sisi server
Mengubah dokumen menjadi gambar halaman di server, sehingga browser menampilkan halaman yang dirender alih-alih mengurai file asli itu sendiri.
Konversi dokumen
Mengubah sebuah file dari satu format ke format lain dan menghasilkan file baru, berbeda dengan rendering, yang menghasilkan representasi visual sementara dan tidak menghasilkan artefak baru.