BookTranslator
BookTranslator

Tłumaczenie skanowanego pliku PDF: problemy z OCR i praktyczne rozwiązania

Dowiedz się, jak wykonać OCR i przetłumaczyć skanowane pliki PDF, diagnozować częste błędy rozpoznawania tekstu oraz zachować układ za pomocą przepływu pracy uwzględniającego strukturę dokumentu.

BookTranslator

BookTranslator Team

9 min read

Szybka odpowiedź: skanowany plik PDF wymaga OCR przed tłumaczeniem

Aby przetłumaczyć skanowany plik PDF, należy najpierw uruchomić OCR, aby przekształcić obrazy stron w tekst możliwy do zaznaczenia. Następnie przetłumacz przetworzony przez OCR plik PDF za pomocą translatora dokumentów, takiego jak PDF Translator. Jeśli pomijzesz OCR, wiele narzędzi tłumaczeniowych zwróci oryginalny plik bez zmian, ominie strony lub przetłumaczy tylko te fragmenty, które już zawierały warstwę tekstową.

Skorzystaj z tego przepływu pracy:

  1. Otwórz plik PDF i spróbuj zaznaczyć zdanie.
  2. Jeśli nie możesz zaznaczyć tekstu, uruchom OCR.
  3. Sprawdź tekst po OCR przed przystąpieniem do tłumaczenia.
  4. Prześlij plik PDF przetworzony przez OCR do PDF Translator.
  5. Porównaj przetłumaczony wynik z oryginalnym skanem.

Jeśli Twój plik PDF ma już zaznaczalny tekst, a problem polega na zachowaniu układu, skorzystaj z przewodnika dotyczącego tłumaczenia pliku PDF bez utraty formatowania.

Dlaczego skanowane pliki PDF zawodzą w narzędziach tłumaczeniowych

Skanowany plik PDF to często po prostu zestaw obrazów stron umieszczonych wewnątrz kontenera PDF. Strona może pokazywać słowa człowiekowa, ale plik może nie zawierać faktycznego tekstu, który oprogramowanie mogłoby wyodrębnić.

To prowadzi do prostego problemu:

Typ plikuCo widzi translatorCo się dzieje
PDF oparty na tekścieTekst oraz dane układuTłumaczenie może rozpocząć się natychmiast.
Skanowany PDF tylko w formie obrazuObrazy stronNajpierw wymagane jest przeprowadzenie OCR.
PDF z tekstem nad obrazemObraz skanu plus ukryta warstwa tekstu OCRTłumaczenie może działać, ale błędy OCR wpływają na jakość.

Najbardziej przydatny test nie ma charakteru technicznego:

  1. Otwórz plik PDF.
  2. Spróbuj zaznaczyć poszczególne słowa.
  3. Skopiuj zdanie.
  4. Wklej je do edytora tekstu.

Jeśli zdanie wkleja się poprawnie, plik PDF posiada warstwę tekstową. Jeśli nic się nie wkleja lub cała strona zachowuje się jak jeden obraz, plik PDF wymaga OCR.

OCR nie jest opcjonalny

OCR oznacza optyczne rozpoznawanie znaków (Optical Character Recognition). Odczytuje ono tekst z obrazu i tworzy tekst czytelny dla maszyn. W przypadku tłumaczenia plików PDF, OCR zazwyczaj tworzy niewidoczną warstwę tekstową nad skanowaną stroną.

Ta warstwa tekstowa staje się źródłem tłumaczenia. Jeśli OCR popełni błędy, tłumaczenie odziedziczy te błędy.

Częste błędy OCR:

Błąd OCRRyzyko dla tłumaczenia
rn odczytane jako mSłowa zmieniają znaczenie.
1 odczytane jako lNumery, odniesienia lub kody stają się błędne.
O odczytane jako 0Identyfikatory, wzory i nazwy mogą ulec uszkodzeniu.
Pominięte akcentyNazwy i terminy stają się niedokładne.
Połączone kolumnyZdania tłumaczą się w niewłaściwej kolejności.
Komórki tabeli odczytane nieprawidłowo wiersz po wierszuEtykiety danych przestają pasować do wartości.
Przypisy traktowane jako tekst głównyCytaty i notatki trafiają w niewłaściwy kontekst.

Dlatego etap weryfikacji OCR ma tak duże znaczenie. Nie tłumacz skanowanego dokumentu, dopóki wyrywkowo nie sprawdzisz wyodrębnionego tekstu.

Przepływ pracy oparty na OCR

Krok 1: Określ typ pliku PDF

Spróbuj zaznaczyć tekst. Jeśli zaznaczanie działa, OCR może nie być konieczny. Jeśli zaznaczanie nie powiodło się, traktuj plik jako plik składający się wyłącznie z obrazów.

Sprawdź również stronę wizualnie:

  • Przekrzywione strony sugerują skan.
  • Szara faktura papieru sugeruje skan.
  • Cienie w pobliżu grzbietu sugerują sfotografowaną książkę.
  • Nierówny kontrast sugeruje kserokopię.
  • Brak wyszukiwania widocznych słów sugeruje brak warstwy tekstowej.

Krok 2: Popraw skan, jeśli to możliwe

Jakość OCR zaczyna się od jakości obrazu. Jeśli możesz wykonać ponowny skan, zrób to, zanim poświęcisz czas na naprawianie błędów OCR.

Skorzystaj z tej listy kontrolnej jakości obrazu:

  • Skanuj w rozdzielczości wystarczająco wysokiej dla małego tekstu.
  • Trzymaj strony płasko i prosto.
  • Unikaj cieni w pobliżu grzbietu.
  • Przytnij krawędzie tabel, palce lub bałagan w tle.
  • Użyj silnego kontrastu między tekstem a stroną.
  • Zachowaj widoczność całej linii.
  • Użyj prawidłowiej orientacji strony.
  • Nie kompresuj obrazu tak mocno, aby litery się rozmazały.

W przypadku starych książek i kserokopii największe korzyści przynosi zazwyczaj prostowanie (deskewing), korekta kontrastu oraz ponowne skanowanie nieostrych stron.

Krok 3: Uruchom OCR

Wybierz narzędzie OCR na podstawie dokumentu, a nie marki.

Opcja OCRNajlepsze dlaNa co uważać
Adobe Acrobat OCROgólne skany biznesowe i czyszczenie plików PDFSprawdź dostęp do obecnego planu przed poleganiem na nim.
ABBYY FineReaderZłożone skany, tabele, kolumny i trudne układyNadal wymaga ręcznego sprawdzenia.
Tesseract lub OCRmyPDFLokalne, techniczne, powtarzalne procesy OCRWymaga znajomości narzędzi wiersza poleceń.
Internetowe narzędzia OCRPliki okazjonalne o niskim ryzykuPrywatność, limity plików i jakość są zmienne.
Aplikacje do skanowania na telefonieSzybkie tworzenie nowego skanuZniekształcenie perspektywy może zaszkodzić OCR.

W przypadku prywatnych umów, dokumentów medycznych, finansowych, niepublikowanych manuskryptów czy prac akademickich podlegających recenzji, preferuj lokalny przepływ pracy OCR lub zaufane środowisko. Nie przesyłaj poufnych skanów do losowych, darmowych witryn OCR.

Krok 4: Sprawdź tekst po OCR

Sprawdzaj tekst przed tłumaczeniem, a nie po nim. Skopiuj tekst z kilku trudnych stron i sprawdź, czy jest czytelny.

Przykładowe strony do sprawdzenia:

  • Strona tytułowa.
  • Strona z gęstym tekstem głównym.
  • Strona z tabelą.
  • Strona z przypisami.
  • Strona z małym tekstem.
  • Strona z pieczątkami, pismem odręcznym lub notatkami na marginesie.
  • Strona w każdym języku, jeśli dokument jest wielojęzyczny.

Szukaj:

  • Brakujących akapitów.
  • Połączonych kolumn.
  • Zepsutych słów.
  • Błędnych znaków.
  • Utraconych znaków diakrytycznych.
  • Etykiet tabel oddzielonych od wartości.
  • Nagłówków wstawionych w tekst główny.
  • Numerów stron wymieszanych ze zdaniami.

Jeśli jakość OCR jest niska, napraw ją przed tłumaczeniem. Tłumacznienie nie jest w stanie niezawodnie odzyskać znaczenia, którego OCR nigdy nie przechwycił.

Krok 5: Przetłumacz plik PDF przetworzony przez OCR

Gdy plik PDF posiada czystą warstwę tekstową, prześlij go do PDF Translator. Etap tłumaczenia może teraz pracować z tekstem zamiast z obrazami stron.

Po zakończeniu tłumaczenia porównaj:

  • Oryginalny skan
  • Warstwę tekstową OCR
  • Przetłumaczony plik PDF

To trójstronne sprawdzenie pomaga ustalić, czy błąd pochodzi z OCR, czy z tłumaczenia. Jeśli tekst OCR jest błędny, uruchom OCR ponownie. Jeśli tekst OCR jest poprawny, ale tłumaczenie jest błędne, popraw tłumaczenie.

Krok 6: Sprawdź treści wysokiego ryzyka

Skanowane dokumenty często zawierają dokładnie te treści, które wymagają dokładnego przeglądu: stare umowy, formularze rządowe, artykuły naukowe, podręczniki, dokumenty historyczne i strony książek.

Sprawdź te elementy ręcznie:

  • Nazwiska i nazwy
  • Daty
  • Numery
  • Adresy
  • Kody produktów
  • Odniesienia prawne
  • Cytaty
  • Etykiety tabel
  • Jednostki
  • Równania
  • Podpisy pod ilustracjami
  • Przypisy

W przypadku materiałów badawczych i akademickich przeczytaj również przewodnik dotyczący tłumaczenia naukowych artykułów badawczych, ponieważ skanowane naukowe pliki PDF dodają ryzyko związane z cytatami i układem do ryzyka związanego z OCR.

Przykłady błędów obok siebie

Korzystaj z tej tabeli podczas przeglądania danych wyjściowych OCR.

Oryginalny skan prawdopodobnie pokazujeZły wynik OCRDlaczego to ma znaczenie
modernmodemZnaczenie zmienia się całkowicie.
Section 10Section IOOdniesienia prawne lub techniczne mogą ulec uszkodzeniu.
20262O26Daty i identyfikatory stają się niewiarygodne.
patientpatlentTerminy medyczne lub techniczne stają się błędne.
Dwie oddzielne kolumnyJeden połączony akapitTłumaczenie czyta zdania w niewłaściwej kolejności.
Wiersz tabeli z etykietami i wartościamiPojedyncza linia zmieszanego tekstuDane nie pasują już do właściwej etykiety.
Znacznike przypisu 1Litera lNotatki mogą przypisać się do niewłaściwego zdania.

Jeśli widzisz te błędy w warstwie OCR, napraw OCR przed tłumaczeniem.

Z jakiego narzędzia powinieneś skorzystać?

Wybierz narzędzie na podstawie trudności dokumentu.

DokumentZalecana ścieżka
Czysty skan biznesowyOCR w programie Acrobat lub innym niezawodnym narzędziu OCR, a następnie PDF Translator.
Skan starej książkiWyrównaj i popraw kontrast, przeprowadź dokładny OCR, a następnie przetłumacz.
Skan artykułu naukowegoPrzeprowadź OCR, sprawdź równania/cytaty/tabele, a następnie przetłumacz z uwzględnieniem układu.
Notatki odręcznePrzed tłumaczeniem może być wymagana transkrypcja ręczna.
Prosty dokument osobistyInternetowy OCR może być akceptowalny, jeśli ryzyko naruszenia prywatności jest niskie.
Dokument poufnyUżyj lokalnego OCR lub zaufanego kontrolowanego przepływu pracy.

Jeśli chcesz zapoznać się z szerszym porównaniem narzędzi, zobacz przewodnik po najlepszych tłumaczach plików PDF.

Częste problemy ze skanowanymi plikami PDF

Strony o niskiej rozdzielczości

Skanowania w niskiej rozdzielczości zlewają litery ze sobą. OCR może mylić rn z m, cl z d lub znaki interpunkcyjne z kurzem.

Rozwiązanie: w miarę możliwości zeskanuj ponownie. Jeśli to niemożliwe, zwiększ kontrast i spróbuj wykonać OCR ponownie.

Przekrzywione lub wygięte strony

Skany książek często wyginają się w pobliżu grzbietu. OCR słabo odczytuje zakrzywione linie i może zmienić kolejność tekstu.

Rozwiązanie: spłaszcz stronę, zeskanuj ponownie lub użyj narzędzia OCR zfunkkcją prostowania i usuwania zniekształceń.

Układ wielokolumnowy

OCR może połączyć lewą i prawą kolumnę w jeden strumień zdań.

Rozwiązanie: sprawdź kolejność czytania przed tłumaczeniem. Artykuły naukowe wymagają w tym miejscu szczególnej uwagi.

Tabele

Tabele są trudne, ponieważ OCR musi wykryć zarówno tekst, jak i strukturę. Tabela może wyglądać poprawnie wizualnie, podczas gdy warstwa tekstowa jest błędna.

Rozwiązanie: skopiuj tekst OCR z tabeli i upewnij się, że etykiety nadal odpowiadają wartościom.

Pismo odręczne i podpisy

OCR dla tekstu drukowanego jest znacznie bardziej niezawodny niż rozpoznawanie pisma odręcznego. Odręczne notatki na marginesie, podpisy i wypełnione formularze mogą zostać pominięte lub zniekształcone.

Rozwiązanie: ręcznie przepisz istotne pismo odręczne przed tłumaczeniem.

Języki mieszane

OCR działa najlepiej, gdy zna język źródłowy. Skan zawierający język angielski, francuski i chiński może się nie powieść, jeśli OCR jest ustawiony tylko na jeden język.

Rozwiązanie: wybierz wszystkie istotne języki OCR, jeśli narzędzie je obsługuje, a następnie wyrywkowo sprawdź każdą sekcję językową.

Lista kontrolna prywatności i bezpieczeństwa

Przed przesłaniem skanowanego pliku PDF w dowolne miejsce zapytaj:

  • Czy dokument zawiera dane osobowe?
  • Czy zawiera materiały medyczne, prawne, finansowe, akademickie lub niepublikowane?
  • Czy jest objęty umową z klientem lub polityką szkoły?
  • Czy internetowa usługa OCR jest dozwolona dla tego dokumentu?
  • Czy zamiast tego potrzebujesz lokalnego przepływu pracy?
  • Czy możesz usunąć strony, które nie wymagają tłumaczenia?

Skanowane pliki PDF są często wrażliwe, ponieważ pochodzą z umów, dowodów osobistych, formularzy, projektów badawczych i wewnętrznych archiwów. Traktuj decyzje o przesłaniu plików do OCR w taki sam sposób, w jaki traktowałbyś oryginalny dokument.

Powiązane wpisy