OCR (optyczne rozpoznawanie znaków)
Definicja
Odtwarzanie tekstu czytelnego dla maszyn z obrazu strony — operacja, która nadaje zeskanowanemu dokumentowi warstwę tekstową, której nigdy nie miał.
OCR jest problemem rozpoznawania, a nie parsowania, co wyjaśnia, dlaczego jest probabilistyczny w sposób, w jaki reszta potoku dokumentów nie jest. Dokładność zależy od rozdzielczości skanu, kontrastu, nachylenia, języka, kroju pisma i złożoności układu. Czysty wydrukowany tekst w rozdzielczości 300 DPI jest prawie rozwiązany. Zeskanowany faksowy odpis ręcznie wypełnionego formularza nie jest.
Ta zmienność ma praktyczną konsekwencję, którą ludzie lekceważą: wynik OCR jest dowodem na to, co strona prawdopodobnie zawiera, a nie wiernym transkryptem. Wyszukiwanie w archiwach przetworzonych przez OCR powinno być traktowane jako pomoc w odnajdywaniu, a nie jako gwarancja, a wszelkie kwestie prawne należy weryfikować względem wyświetlanej strony.
OCR wymaga również znacząco więcej mocy obliczeniowej niż renderowanie, co powoduje, że zazwyczaj jest operacją wsadową na archiwum, a nie czymś, co uruchamiasz, gdy użytkownik otwiera plik.
W Doconut
OCR jest dostępny wyłącznie poprzez płatną wtyczkę AdvancedSearch i nie jest obecnie powszechnie dostępny — silnik OCR jest przebudowywany. Nie planuj wokół OCR Doconut i nie opisuj go jako darmowej lub wbudowanej funkcji. Dokumenty przychodzące jako skany renderują się poprawnie; po prostu nie są przeszukiwalne.
Powiązane terminy
Warstwa tekstowa
Tekst czytelny dla maszyn, przechowywany w dokumencie wraz z jego wyglądem wizualnym. To on umożliwia wyszukiwanie i zaznaczanie tekstu, a dokładnie tego nie ma zeskanowana strona.
Konwersja dokumentów
Przekształcanie pliku z jednego formatu na inny i tworzenie nowego pliku, w odróżnieniu od renderowania, które tworzy tymczasową wizualną reprezentację i nie generuje nowego artefaktu.