OCR(光学字符识别)

定义

将页面图像重建为机器可读文本——为扫描文档提供从未拥有的文本层的操作。

OCR 是一个识别问题,而非解析问题,这就是它在概率上与文档流水线的其他部分不同的原因。准确性取决于扫描分辨率、对比度、倾斜、语言、字体和布局复杂度。干净的 300 DPI 打印文本基本已解决。手写表格的传真复印件则不然。

这种可变性有一个人们常低估的实际后果:OCR 输出是页面可能内容的证据,而不是忠实的转录。对 OCR 文档的搜索应视为召回辅助,而非保证,任何具有法律后果的内容都应与渲染页面核对。

OCR 也比渲染消耗显著更多的计算资源,这就是它通常作为批处理操作针对档案而非用户打开文件时运行的原因。

在 Doconut

OCR 仅通过付费的 AdvancedSearch 插件提供,且目前尚未普遍可用——OCR 引擎正在重新构建。不要围绕 Doconut OCR 进行规划,也不要将其描述为免费或内置功能。以扫描形式到达的文档会正确渲染;它们只是不可搜索。

了解实际运行方式

仅靠定义只能帮助你到此为止。临时许可证可在你自己的机器上运行,针对你自己的文档。