OCR (optyczne rozpoznawanie znaków)

Definicja

Odtwarzanie tekstu czytelnego dla maszyn z obrazu strony — operacja, która nadaje zeskanowanemu dokumentowi warstwę tekstową, której nigdy nie miał.

OCR jest problemem rozpoznawania, a nie parsowania, co wyjaśnia, dlaczego jest probabilistyczny w sposób, w jaki reszta potoku dokumentów nie jest. Dokładność zależy od rozdzielczości skanu, kontrastu, nachylenia, języka, kroju pisma i złożoności układu. Czysty wydrukowany tekst w rozdzielczości 300 DPI jest prawie rozwiązany. Zeskanowany faksowy odpis ręcznie wypełnionego formularza nie jest.

Ta zmienność ma praktyczną konsekwencję, którą ludzie lekceważą: wynik OCR jest dowodem na to, co strona prawdopodobnie zawiera, a nie wiernym transkryptem. Wyszukiwanie w archiwach przetworzonych przez OCR powinno być traktowane jako pomoc w odnajdywaniu, a nie jako gwarancja, a wszelkie kwestie prawne należy weryfikować względem wyświetlanej strony.

OCR wymaga również znacząco więcej mocy obliczeniowej niż renderowanie, co powoduje, że zazwyczaj jest operacją wsadową na archiwum, a nie czymś, co uruchamiasz, gdy użytkownik otwiera plik.

W Doconut

OCR jest dostępny wyłącznie poprzez płatną wtyczkę AdvancedSearch i nie jest obecnie powszechnie dostępny — silnik OCR jest przebudowywany. Nie planuj wokół OCR Doconut i nie opisuj go jako darmowej lub wbudowanej funkcji. Dokumenty przychodzące jako skany renderują się poprawnie; po prostu nie są przeszukiwalne.

Zobacz, jak to działa w praktyce

Definicje zabiorą cię tylko tak daleko. Tymczasowa licencja działa na twoim własnym komputerze, na własnych dokumentach.