텍스트 레이어

정의

문서 내부에 시각적 모습과 함께 저장된 기계가 읽을 수 있는 텍스트입니다. 이것이 검색 및 텍스트 선택을 가능하게 하며, 스캔된 페이지에 정확히 없는 것입니다.

디지털 원본 PDF는 각 글리프의 그림과 해당 글리프가 나타내는 문자의 기록을 모두 포함합니다. 두 번째가 존재하기 때문에 검색이 작동합니다. 스캔된 페이지는 그림만 포함하며 — 시각적으로는 동일하지만 기능적으로는 무효합니다.

이는 문서 검색 프로젝트에서 가장 흔한 혼란의 원인입니다. "이 파일에서는 검색이 작동하지 않는다"는 거의 항상 "이 파일들은 스캔된 것이다"를 의미하며, 검색 엔진을 아무리 조정해도 변하지 않습니다. 해결책은 OCR이며, 이는 별도의 작업으로 상당히 비용이 많이 듭니다.

오피스 형식은 쉬운 경우입니다: DOCX나 XLSX는 구조화된 텍스트이므로 텍스트 레이어가 없을 리 없습니다.

Doconut에서

전체 텍스트 검색은 텍스트 레이어를 대상으로 수행되며, 유료 AdvancedSearch 플러그인으로 제공됩니다. 문서에 텍스트 레이어가 없으면 올바르게 렌더링되지만 검색 결과가 반환되지 않습니다.

실제로 어떻게 작동하는지 확인하세요

정의만으로는 한계가 있습니다. 임시 라이선스는 여러분의 머신에서, 여러분의 문서에 대해 실행됩니다.