Metin katmanı
Tanım
Bir belgenin içinde görsel görünümüyle birlikte depolanan makine tarafından okunabilir metin. Arama ve metin seçimini mümkün kılan şey budur ve tam olarak taranmış bir sayfanın sahip olmadığı şeydir.
Doğrudan dijital oluşturulmuş bir PDF, her glifin bir çizimini ve o glifin temsil ettiği karakterin kaydını içerir. Arama, ikinci şey mevcut olduğu için çalışır. Taranmış bir sayfa sadece resmi taşır — görsel olarak aynı, işlevsel olarak etkisiz.
Bu, belge arama projelerinde en yaygın karışıklık kaynağıdır. "Arama bu dosyalarda çalışmıyor" ifadesi neredeyse her zaman "bu dosyalar taranmış" anlamına gelir ve arama motorunun ne kadar ayarlanması bu durumu değiştirmez. Çözüm OCR'dir; bu farklı ve oldukça daha maliyetli bir işlemdir.
Ofis formatları kolay durumdur: bir DOCX veya XLSX, yapısı gereği yapılandırılmış metindir, bu yüzden metin katmanı asla sorun olmaz.
Doconut'ta
Tam metin arama, metin katmanı üzerinde çalışır ve ücretli AdvancedSearch eklentisi tarafından sağlanır. Bir belgenin metin katmanı yoksa, doğru şekilde render edilir ancak arama sonuçları döndürmez.
İlgili terimler
OCR (optik karakter tanıma)
Bir sayfanın görüntüsünden makine tarafından okunabilir metni yeniden oluşturma — taranmış bir belgeye asla doğmadığı metin katmanını veren işlem.
Sunucu tarafı belge işleme
Bir belgeyi sunucuda sayfa görüntülerine dönüştürmek, böylece tarayıcı orijinal dosyayı doğrudan ayrıştırmak yerine işlenmiş sayfaları gösterir.
Belge dönüştürme
Bir dosyayı bir formattan diğerine dönüştürmek ve yeni bir dosya üretmek, geçici bir görsel temsil üreten ve yeni bir eser oluşturmayan renderlemeden farklıdır.