เลเยอร์ข้อความ

คำนิยาม

ข้อความที่เครื่องอ่านได้ซึ่งถูกเก็บไว้ในเอกสารพร้อมกับลักษณะการแสดงผลของมัน มันทำให้การค้นหาและการเลือกข้อความเป็นไปได้ และเป็นสิ่งที่หน้าที่สแกนไม่มีอย่างแน่นอน

PDF ที่สร้างขึ้นเป็นดิจิทัลจะมีทั้งรูปภาพของแต่ละ glyph และบันทึกว่าตัวอักษรใดที่ glyph นั้นแสดงผล การค้นหาทำงานได้เพราะมีข้อมูลที่สอง หน้าที่สแกนจะมีเพียงรูปภาพเท่านั้น — เหมือนกันทางสายตา แต่ไม่มีฟังก์ชันการทำงาน

นี่เป็นแหล่งที่มาของความสับสนที่พบบ่อยที่สุดในโครงการค้นหาเอกสาร "การค้นหาไม่ทำงานกับไฟล์เหล่านี้" มักหมายความว่า "ไฟล์เหล่านี้ถูกสแกน" และการปรับแต่งเครื่องมือค้นหาใด ๆ ก็ไม่สามารถเปลี่ยนแปลงได้ วิธีแก้คือ OCR ซึ่งเป็นกระบวนการที่แตกต่างและมีค่าใช้จ่ายสูงกว่ามาก

รูปแบบเอกสารของสำนักงานเป็นกรณีที่ง่าย: DOCX หรือ XLSX เป็นข้อความที่มีโครงสร้างตามการสร้าง ดังนั้นเลเยอร์ข้อความจึงไม่เป็นปัญหา

ใน Doconut

การค้นหาแบบเต็มข้อความทำงานกับเลเยอร์ข้อความและได้รับการสนับสนุนโดยปลั๊กอิน AdvancedSearch ที่ต้องชำระเงิน หากเอกสารไม่มีเลเยอร์ข้อความ มันจะแสดงผลได้อย่างถูกต้องแต่จะไม่มีผลลัพธ์การค้นหา

ดูว่ามันทำงานอย่างไรในทางปฏิบัติ

คำนิยามเพียงอย่างเดียวไม่พอ ใบอนุญาตชั่วคราวทำงานบนเครื่องของคุณเอง กับเอกสารของคุณเอง.