文本层

定义

存储在文档内部、与其视觉外观并存的机器可读文本。它使搜索和文本选择成为可能,而扫描页面正是缺少的。

原生数字 PDF 同时包含每个字形的绘制以及该字形对应的字符记录。搜索之所以可行,是因为第二项存在。扫描页面仅携带图片——视觉上相同,但功能上是惰性的。

这是文档搜索项目中最常见的混淆来源。"这些文件无法搜索"几乎总是意味着"这些文件是扫描的",无论对搜索引擎进行多少调优都无法改变这一点。解决办法是 OCR,这是一种不同且成本显著更高的操作。

Office 格式是简单的情况:DOCX 或 XLSX 本身就是结构化文本,因此文本层从不成问题。

在 Doconut

全文搜索针对文本层进行,并由付费的 AdvancedSearch 插件提供。如果文档没有文本层,它仍能正确渲染,但不会返回搜索结果。

了解实际运行方式

仅靠定义只能帮助你到此为止。临时许可证可在你自己的机器上运行,针对你自己的文档。