Tłumaczenie skanowanego pliku PDF: problemy z OCR i praktyczne rozwiązania
Dowiedz się, jak wykonać OCR i przetłumaczyć skanowane pliki PDF, diagnozować częste błędy rozpoznawania tekstu oraz zachować układ za pomocą przepływu pracy uwzględniającego strukturę dokumentu.

Szybka odpowiedź: skanowany plik PDF wymaga OCR przed tłumaczeniem
Aby przetłumaczyć skanowany plik PDF, należy najpierw uruchomić OCR, aby przekształcić obrazy stron w tekst możliwy do zaznaczenia. Następnie przetłumacz przetworzony przez OCR plik PDF za pomocą translatora dokumentów, takiego jak PDF Translator. Jeśli pomijzesz OCR, wiele narzędzi tłumaczeniowych zwróci oryginalny plik bez zmian, ominie strony lub przetłumaczy tylko te fragmenty, które już zawierały warstwę tekstową.
Skorzystaj z tego przepływu pracy:
- Otwórz plik PDF i spróbuj zaznaczyć zdanie.
- Jeśli nie możesz zaznaczyć tekstu, uruchom OCR.
- Sprawdź tekst po OCR przed przystąpieniem do tłumaczenia.
- Prześlij plik PDF przetworzony przez OCR do PDF Translator.
- Porównaj przetłumaczony wynik z oryginalnym skanem.
Jeśli Twój plik PDF ma już zaznaczalny tekst, a problem polega na zachowaniu układu, skorzystaj z przewodnika dotyczącego tłumaczenia pliku PDF bez utraty formatowania.
Dlaczego skanowane pliki PDF zawodzą w narzędziach tłumaczeniowych
Skanowany plik PDF to często po prostu zestaw obrazów stron umieszczonych wewnątrz kontenera PDF. Strona może pokazywać słowa człowiekowa, ale plik może nie zawierać faktycznego tekstu, który oprogramowanie mogłoby wyodrębnić.
To prowadzi do prostego problemu:
| Typ pliku | Co widzi translator | Co się dzieje |
|---|---|---|
| PDF oparty na tekście | Tekst oraz dane układu | Tłumaczenie może rozpocząć się natychmiast. |
| Skanowany PDF tylko w formie obrazu | Obrazy stron | Najpierw wymagane jest przeprowadzenie OCR. |
| PDF z tekstem nad obrazem | Obraz skanu plus ukryta warstwa tekstu OCR | Tłumaczenie może działać, ale błędy OCR wpływają na jakość. |
Najbardziej przydatny test nie ma charakteru technicznego:
- Otwórz plik PDF.
- Spróbuj zaznaczyć poszczególne słowa.
- Skopiuj zdanie.
- Wklej je do edytora tekstu.
Jeśli zdanie wkleja się poprawnie, plik PDF posiada warstwę tekstową. Jeśli nic się nie wkleja lub cała strona zachowuje się jak jeden obraz, plik PDF wymaga OCR.
OCR nie jest opcjonalny
OCR oznacza optyczne rozpoznawanie znaków (Optical Character Recognition). Odczytuje ono tekst z obrazu i tworzy tekst czytelny dla maszyn. W przypadku tłumaczenia plików PDF, OCR zazwyczaj tworzy niewidoczną warstwę tekstową nad skanowaną stroną.
Ta warstwa tekstowa staje się źródłem tłumaczenia. Jeśli OCR popełni błędy, tłumaczenie odziedziczy te błędy.
Częste błędy OCR:
| Błąd OCR | Ryzyko dla tłumaczenia |
|---|---|
rn odczytane jako m | Słowa zmieniają znaczenie. |
1 odczytane jako l | Numery, odniesienia lub kody stają się błędne. |
O odczytane jako 0 | Identyfikatory, wzory i nazwy mogą ulec uszkodzeniu. |
| Pominięte akcenty | Nazwy i terminy stają się niedokładne. |
| Połączone kolumny | Zdania tłumaczą się w niewłaściwej kolejności. |
| Komórki tabeli odczytane nieprawidłowo wiersz po wierszu | Etykiety danych przestają pasować do wartości. |
| Przypisy traktowane jako tekst główny | Cytaty i notatki trafiają w niewłaściwy kontekst. |
Dlatego etap weryfikacji OCR ma tak duże znaczenie. Nie tłumacz skanowanego dokumentu, dopóki wyrywkowo nie sprawdzisz wyodrębnionego tekstu.
Przepływ pracy oparty na OCR
Krok 1: Określ typ pliku PDF
Spróbuj zaznaczyć tekst. Jeśli zaznaczanie działa, OCR może nie być konieczny. Jeśli zaznaczanie nie powiodło się, traktuj plik jako plik składający się wyłącznie z obrazów.
Sprawdź również stronę wizualnie:
- Przekrzywione strony sugerują skan.
- Szara faktura papieru sugeruje skan.
- Cienie w pobliżu grzbietu sugerują sfotografowaną książkę.
- Nierówny kontrast sugeruje kserokopię.
- Brak wyszukiwania widocznych słów sugeruje brak warstwy tekstowej.
Krok 2: Popraw skan, jeśli to możliwe
Jakość OCR zaczyna się od jakości obrazu. Jeśli możesz wykonać ponowny skan, zrób to, zanim poświęcisz czas na naprawianie błędów OCR.
Skorzystaj z tej listy kontrolnej jakości obrazu:
- Skanuj w rozdzielczości wystarczająco wysokiej dla małego tekstu.
- Trzymaj strony płasko i prosto.
- Unikaj cieni w pobliżu grzbietu.
- Przytnij krawędzie tabel, palce lub bałagan w tle.
- Użyj silnego kontrastu między tekstem a stroną.
- Zachowaj widoczność całej linii.
- Użyj prawidłowiej orientacji strony.
- Nie kompresuj obrazu tak mocno, aby litery się rozmazały.
W przypadku starych książek i kserokopii największe korzyści przynosi zazwyczaj prostowanie (deskewing), korekta kontrastu oraz ponowne skanowanie nieostrych stron.
Krok 3: Uruchom OCR
Wybierz narzędzie OCR na podstawie dokumentu, a nie marki.
| Opcja OCR | Najlepsze dla | Na co uważać |
|---|---|---|
| Adobe Acrobat OCR | Ogólne skany biznesowe i czyszczenie plików PDF | Sprawdź dostęp do obecnego planu przed poleganiem na nim. |
| ABBYY FineReader | Złożone skany, tabele, kolumny i trudne układy | Nadal wymaga ręcznego sprawdzenia. |
| Tesseract lub OCRmyPDF | Lokalne, techniczne, powtarzalne procesy OCR | Wymaga znajomości narzędzi wiersza poleceń. |
| Internetowe narzędzia OCR | Pliki okazjonalne o niskim ryzyku | Prywatność, limity plików i jakość są zmienne. |
| Aplikacje do skanowania na telefonie | Szybkie tworzenie nowego skanu | Zniekształcenie perspektywy może zaszkodzić OCR. |
W przypadku prywatnych umów, dokumentów medycznych, finansowych, niepublikowanych manuskryptów czy prac akademickich podlegających recenzji, preferuj lokalny przepływ pracy OCR lub zaufane środowisko. Nie przesyłaj poufnych skanów do losowych, darmowych witryn OCR.
Krok 4: Sprawdź tekst po OCR
Sprawdzaj tekst przed tłumaczeniem, a nie po nim. Skopiuj tekst z kilku trudnych stron i sprawdź, czy jest czytelny.
Przykładowe strony do sprawdzenia:
- Strona tytułowa.
- Strona z gęstym tekstem głównym.
- Strona z tabelą.
- Strona z przypisami.
- Strona z małym tekstem.
- Strona z pieczątkami, pismem odręcznym lub notatkami na marginesie.
- Strona w każdym języku, jeśli dokument jest wielojęzyczny.
Szukaj:
- Brakujących akapitów.
- Połączonych kolumn.
- Zepsutych słów.
- Błędnych znaków.
- Utraconych znaków diakrytycznych.
- Etykiet tabel oddzielonych od wartości.
- Nagłówków wstawionych w tekst główny.
- Numerów stron wymieszanych ze zdaniami.
Jeśli jakość OCR jest niska, napraw ją przed tłumaczeniem. Tłumacznienie nie jest w stanie niezawodnie odzyskać znaczenia, którego OCR nigdy nie przechwycił.
Krok 5: Przetłumacz plik PDF przetworzony przez OCR
Gdy plik PDF posiada czystą warstwę tekstową, prześlij go do PDF Translator. Etap tłumaczenia może teraz pracować z tekstem zamiast z obrazami stron.
Po zakończeniu tłumaczenia porównaj:
- Oryginalny skan
- Warstwę tekstową OCR
- Przetłumaczony plik PDF
To trójstronne sprawdzenie pomaga ustalić, czy błąd pochodzi z OCR, czy z tłumaczenia. Jeśli tekst OCR jest błędny, uruchom OCR ponownie. Jeśli tekst OCR jest poprawny, ale tłumaczenie jest błędne, popraw tłumaczenie.
Krok 6: Sprawdź treści wysokiego ryzyka
Skanowane dokumenty często zawierają dokładnie te treści, które wymagają dokładnego przeglądu: stare umowy, formularze rządowe, artykuły naukowe, podręczniki, dokumenty historyczne i strony książek.
Sprawdź te elementy ręcznie:
- Nazwiska i nazwy
- Daty
- Numery
- Adresy
- Kody produktów
- Odniesienia prawne
- Cytaty
- Etykiety tabel
- Jednostki
- Równania
- Podpisy pod ilustracjami
- Przypisy
W przypadku materiałów badawczych i akademickich przeczytaj również przewodnik dotyczący tłumaczenia naukowych artykułów badawczych, ponieważ skanowane naukowe pliki PDF dodają ryzyko związane z cytatami i układem do ryzyka związanego z OCR.
Przykłady błędów obok siebie
Korzystaj z tej tabeli podczas przeglądania danych wyjściowych OCR.
| Oryginalny skan prawdopodobnie pokazuje | Zły wynik OCR | Dlaczego to ma znaczenie |
|---|---|---|
modern | modem | Znaczenie zmienia się całkowicie. |
Section 10 | Section IO | Odniesienia prawne lub techniczne mogą ulec uszkodzeniu. |
2026 | 2O26 | Daty i identyfikatory stają się niewiarygodne. |
patient | patlent | Terminy medyczne lub techniczne stają się błędne. |
| Dwie oddzielne kolumny | Jeden połączony akapit | Tłumaczenie czyta zdania w niewłaściwej kolejności. |
| Wiersz tabeli z etykietami i wartościami | Pojedyncza linia zmieszanego tekstu | Dane nie pasują już do właściwej etykiety. |
Znacznike przypisu 1 | Litera l | Notatki mogą przypisać się do niewłaściwego zdania. |
Jeśli widzisz te błędy w warstwie OCR, napraw OCR przed tłumaczeniem.
Z jakiego narzędzia powinieneś skorzystać?
Wybierz narzędzie na podstawie trudności dokumentu.
| Dokument | Zalecana ścieżka |
|---|---|
| Czysty skan biznesowy | OCR w programie Acrobat lub innym niezawodnym narzędziu OCR, a następnie PDF Translator. |
| Skan starej książki | Wyrównaj i popraw kontrast, przeprowadź dokładny OCR, a następnie przetłumacz. |
| Skan artykułu naukowego | Przeprowadź OCR, sprawdź równania/cytaty/tabele, a następnie przetłumacz z uwzględnieniem układu. |
| Notatki odręczne | Przed tłumaczeniem może być wymagana transkrypcja ręczna. |
| Prosty dokument osobisty | Internetowy OCR może być akceptowalny, jeśli ryzyko naruszenia prywatności jest niskie. |
| Dokument poufny | Użyj lokalnego OCR lub zaufanego kontrolowanego przepływu pracy. |
Jeśli chcesz zapoznać się z szerszym porównaniem narzędzi, zobacz przewodnik po najlepszych tłumaczach plików PDF.
Częste problemy ze skanowanymi plikami PDF
Strony o niskiej rozdzielczości
Skanowania w niskiej rozdzielczości zlewają litery ze sobą. OCR może mylić rn z m, cl z d lub znaki interpunkcyjne z kurzem.
Rozwiązanie: w miarę możliwości zeskanuj ponownie. Jeśli to niemożliwe, zwiększ kontrast i spróbuj wykonać OCR ponownie.
Przekrzywione lub wygięte strony
Skany książek często wyginają się w pobliżu grzbietu. OCR słabo odczytuje zakrzywione linie i może zmienić kolejność tekstu.
Rozwiązanie: spłaszcz stronę, zeskanuj ponownie lub użyj narzędzia OCR zfunkkcją prostowania i usuwania zniekształceń.
Układ wielokolumnowy
OCR może połączyć lewą i prawą kolumnę w jeden strumień zdań.
Rozwiązanie: sprawdź kolejność czytania przed tłumaczeniem. Artykuły naukowe wymagają w tym miejscu szczególnej uwagi.
Tabele
Tabele są trudne, ponieważ OCR musi wykryć zarówno tekst, jak i strukturę. Tabela może wyglądać poprawnie wizualnie, podczas gdy warstwa tekstowa jest błędna.
Rozwiązanie: skopiuj tekst OCR z tabeli i upewnij się, że etykiety nadal odpowiadają wartościom.
Pismo odręczne i podpisy
OCR dla tekstu drukowanego jest znacznie bardziej niezawodny niż rozpoznawanie pisma odręcznego. Odręczne notatki na marginesie, podpisy i wypełnione formularze mogą zostać pominięte lub zniekształcone.
Rozwiązanie: ręcznie przepisz istotne pismo odręczne przed tłumaczeniem.
Języki mieszane
OCR działa najlepiej, gdy zna język źródłowy. Skan zawierający język angielski, francuski i chiński może się nie powieść, jeśli OCR jest ustawiony tylko na jeden język.
Rozwiązanie: wybierz wszystkie istotne języki OCR, jeśli narzędzie je obsługuje, a następnie wyrywkowo sprawdź każdą sekcję językową.
Lista kontrolna prywatności i bezpieczeństwa
Przed przesłaniem skanowanego pliku PDF w dowolne miejsce zapytaj:
- Czy dokument zawiera dane osobowe?
- Czy zawiera materiały medyczne, prawne, finansowe, akademickie lub niepublikowane?
- Czy jest objęty umową z klientem lub polityką szkoły?
- Czy internetowa usługa OCR jest dozwolona dla tego dokumentu?
- Czy zamiast tego potrzebujesz lokalnego przepływu pracy?
- Czy możesz usunąć strony, które nie wymagają tłumaczenia?
Skanowane pliki PDF są często wrażliwe, ponieważ pochodzą z umów, dowodów osobistych, formularzy, projektów badawczych i wewnętrznych archiwów. Traktuj decyzje o przesłaniu plików do OCR w taki sam sposób, w jaki traktowałbyś oryginalny dokument.
Powiązane wpisy





