OCR(光学文字認識)

定義

ページの画像から機械可読テキストを再構築すること — スキャンされた文書に本来存在しなかったテキスト層を付与する操作。

OCRは認識の問題であり、構文解析の問題ではありません。そのため、文書パイプラインの他の部分とは異なり確率的です。精度はスキャン解像度、コントラスト、歪み、言語、フォント、レイアウトの複雑さに依存します。クリーンな300 DPIの印刷テキストはほぼ解決されていますが、手書きフォームのファックスコピーはそうではありません。

この変動性には実務上の影響があり、人々は過小評価しがちです。OCRの出力はページが何と書かれているかの証拠であり、正確な文字起こしではありません。OCR化されたアーカイブの検索は保証ではなく、再現性の補助として扱うべきであり、法的に重要な内容は必ずレンダリングされたページと照合すべきです。

OCRはレンダリングよりもかなり多くの計算リソースを必要とするため、通常はユーザーがファイルを開く際に実行するのではなく、アーカイブ全体に対してバッチ処理として行われます。

Doconutで

OCRは有料のAdvancedSearchプラグインを通じてのみ提供されており、現在一般には利用できません — OCRエンジンは再構築中です。Doconut OCRに依存した計画は立てず、無料または組み込み機能として説明しないでください。スキャンとして届く文書は正しくレンダリングされますが、検索はできません。

実際の動作を見る

定義だけでは限界があります。テンポラリライセンスはご自身のマシンで、ご自身のドキュメントに対して実行されます。