เลเยอร์ข้อความ
คำนิยาม
ข้อความที่เครื่องอ่านได้ซึ่งถูกเก็บไว้ในเอกสารพร้อมกับลักษณะการแสดงผลของมัน มันทำให้การค้นหาและการเลือกข้อความเป็นไปได้ และเป็นสิ่งที่หน้าที่สแกนไม่มีอย่างแน่นอน
PDF ที่สร้างขึ้นเป็นดิจิทัลจะมีทั้งรูปภาพของแต่ละ glyph และบันทึกว่าตัวอักษรใดที่ glyph นั้นแสดงผล การค้นหาทำงานได้เพราะมีข้อมูลที่สอง หน้าที่สแกนจะมีเพียงรูปภาพเท่านั้น — เหมือนกันทางสายตา แต่ไม่มีฟังก์ชันการทำงาน
นี่เป็นแหล่งที่มาของความสับสนที่พบบ่อยที่สุดในโครงการค้นหาเอกสาร "การค้นหาไม่ทำงานกับไฟล์เหล่านี้" มักหมายความว่า "ไฟล์เหล่านี้ถูกสแกน" และการปรับแต่งเครื่องมือค้นหาใด ๆ ก็ไม่สามารถเปลี่ยนแปลงได้ วิธีแก้คือ OCR ซึ่งเป็นกระบวนการที่แตกต่างและมีค่าใช้จ่ายสูงกว่ามาก
รูปแบบเอกสารของสำนักงานเป็นกรณีที่ง่าย: DOCX หรือ XLSX เป็นข้อความที่มีโครงสร้างตามการสร้าง ดังนั้นเลเยอร์ข้อความจึงไม่เป็นปัญหา
ใน Doconut
การค้นหาแบบเต็มข้อความทำงานกับเลเยอร์ข้อความและได้รับการสนับสนุนโดยปลั๊กอิน AdvancedSearch ที่ต้องชำระเงิน หากเอกสารไม่มีเลเยอร์ข้อความ มันจะแสดงผลได้อย่างถูกต้องแต่จะไม่มีผลลัพธ์การค้นหา
คำที่เกี่ยวข้อง
OCR (การจดจำอักขระด้วยแสง)
การสร้างข้อความที่เครื่องอ่านได้จากภาพของหน้า — การดำเนินการที่ให้เอกสารสแกนมีชั้นข้อความที่มันไม่เคยมีตั้งแต่แรก.
การเรนเดอร์เอกสารบนเซิร์ฟเวอร์
การแปลงเอกสารเป็นภาพหน้าบนเซิร์ฟเวอร์ ทำให้เบราว์เซอร์แสดงหน้าที่เรนเดอร์แล้วแทนการวิเคราะห์ไฟล์ต้นฉบับโดยตรง.
การแปลงเอกสาร
การแปลงไฟล์จากรูปแบบหนึ่งเป็นอีกรูปแบบหนึ่งและสร้างไฟล์ใหม่ ซึ่งแตกต่างจากการเรนเดอร์ที่สร้างการแสดงผลชั่วคราวและไม่มีศิลปวัตถุใหม่