Jak przetłumaczyć zeskanowany plik PDF: kompletny przewodnik po OCR i tłumaczeniu
Zeskanowane pliki PDF zawierają obrazy tekstu, a nie prawdziwy tekst — dlatego Google Translate zwraca je bez zmian. Oto proces OCR + AI, który to naprawia.

Szybka odpowiedź: zeskanowany PDF wymaga OCR przed tłumaczeniem
Aby przetłumaczyć zeskanowany plik PDF, najpierw uruchom OCR, aby zamienić obrazy stron w tekst, który można zaznaczać. Następnie przetłumacz plik PDF po przetworzeniu OCR za pomocą tłumacza dokumentów, takiego jak Tłumacz PDF. Jeśli pominiesz OCR, wiele narzędzi do tłumaczenia zwróci oryginalny plik bez zmian, pominie niektóre strony albo przetłumaczy tylko te fragmenty, które już zawierają warstwę tekstową.
Użyj tego procesu:
- Otwórz plik PDF i spróbuj zaznaczyć jedno zdanie.
- Jeśli nie możesz zaznaczyć tekstu, uruchom OCR.
- Przed tłumaczeniem sprawdź tekst z OCR.
- Prześlij plik PDF po OCR do Tłumacza PDF.
- Porównaj przetłumaczony wynik z oryginalnym skanem.
Jeśli Twój PDF ma już tekst możliwy do zaznaczania, a problem dotyczy zachowania układu, skorzystaj z poradnika, jak przetłumaczyć PDF bez utraty formatowania.
Dlaczego zeskanowane pliki PDF nie działają w narzędziach do tłumaczenia
Zeskanowany plik PDF to często po prostu zestaw obrazów stron zamkniętych w kontenerze PDF. Dla człowieka strona może wyglądać jak tekst, ale plik może nie zawierać rzeczywistego tekstu, który oprogramowanie potrafi wyodrębnić.
To prowadzi do prostego problemu:
| Typ pliku | Co widzi tłumacz | Co się dzieje |
|---|---|---|
| PDF oparty na tekście | Tekst plus dane układu | Tłumaczenie może zacząć się od razu. |
| Zeskanowany PDF zawierający wyłącznie obrazy | Obrazy stron | Najpierw wymagany jest OCR. |
| PDF z tekstem na obrazie | Obraz skanu plus ukryta warstwa tekstowa OCR | Tłumaczenie może działać, ale błędy OCR wpływają na jakość. |
Najbardziej użyteczny test nie jest techniczny:
- Otwórz plik PDF.
- Spróbuj zaznaczyć pojedyncze słowa.
- Skopiuj jedno zdanie.
- Wklej je do edytora tekstu.
Jeśli zdanie wkleja się poprawnie, plik PDF ma warstwę tekstową. Jeśli nie wkleja się nic albo cała strona zachowuje się jak jeden obraz, plik PDF wymaga OCR.
OCR nie jest opcjonalny
OCR oznacza optyczne rozpoznawanie znaków. Odczytuje tekst z obrazu i tworzy tekst czytelny dla komputera. W przypadku tłumaczenia PDF OCR zwykle tworzy niewidoczną warstwę tekstową na zeskanowanej stronie.
Ta warstwa tekstowa staje się źródłem tłumaczenia. Jeśli OCR popełnia błędy, tłumaczenie przejmuje te błędy.
Typowe błędy OCR:
| Błąd OCR | Ryzyko dla tłumaczenia |
|---|---|
rn odczytane jako m | Słowa zmieniają znaczenie. |
1 odczytane jako l | Błędne stają się liczby, odwołania lub kody. |
O odczytane jako 0 | Identyfikatory, wzory i nazwy mogą zostać zniekształcone. |
| Pominięte znaki diakrytyczne | Nazwy i terminy stają się niedokładne. |
| Scalanie kolumn | Zdania są tłumaczone w złej kolejności. |
| Komórki tabeli odczytane nieprawidłowo wiersz po wierszu | Etykiety danych przestają odpowiadać wartościom. |
| Przypisy potraktowane jako tekst główny | Cytowania i uwagi trafiają do niewłaściwego kontekstu. |
Dlatego etap sprawdzania OCR ma znaczenie. Nie tłumacz zeskanowanego dokumentu, dopóki nie sprawdzisz wyrywkowo wyodrębnionego tekstu.
Proces pracy: najpierw OCR
Krok 1: Określ typ pliku PDF
Spróbuj zaznaczyć tekst. Jeśli zaznaczanie działa, OCR może nie być potrzebny. Jeśli zaznaczanie się nie powiedzie, traktuj plik jako zawierający wyłącznie obrazy.
Przyjrzyj się też stronie wizualnie:
- Przekrzywione strony sugerują skan.
- Szara faktura papieru sugeruje skan.
- Cienie przy grzbiecie sugerują sfotografowaną książkę.
- Nierówny kontrast sugeruje kserokopię.
- Jeśli wyszukiwanie nie znajduje widocznych słów, prawdopodobnie nie ma warstwy tekstowej.
Krok 2: Popraw skan, jeśli to możliwe
Jakość OCR zaczyna się od jakości obrazu. Jeśli możesz zeskanować dokument ponownie, zrób to, zanim poświęcisz czas na poprawianie błędów OCR.
Skorzystaj z tej listy kontrolnej jakości obrazu:
- Skanuj w rozdzielczości wystarczającej dla drobnego tekstu.
- Utrzymuj strony płasko i prosto.
- Unikaj cieni przy grzbiecie.
- Przytnij krawędzie stołu, palce i zbędne elementy tła.
- Zadbaj o wyraźny kontrast między tekstem a stroną.
- Upewnij się, że cała linia jest widoczna.
- Użyj prawidłowej orientacji strony.
- Nie kompresuj obrazu tak mocno, aby litery się rozmazały.
W przypadku starych książek i kserokopii największą poprawę zwykle dają prostowanie obrazu, korekcja kontrastu i ponowne skanowanie stron, które są nieostre.
Krok 3: Uruchom OCR
Wybieraj narzędzie OCR na podstawie dokumentu, a nie marki.
| Opcja OCR | Najlepsze zastosowanie | Uważaj na |
|---|---|---|
| OCR w Adobe Acrobat | Typowe skany biznesowe i porządkowanie PDF-ów | Zanim na nim polegasz, sprawdź dostęp w aktualnym planie. |
| ABBYY FineReader | Złożone skany, tabele, kolumny i trudne układy | Nadal wymaga ręcznej kontroli. |
| Tesseract lub OCRmyPDF | Lokalny, techniczny i powtarzalny workflow OCR | Wymaga swobody w pracy z narzędziami wiersza poleceń. |
| Narzędzia OCR online | Sporadyczne pliki o niskim ryzyku | Różnią się prywatnością, limitami plików i jakością. |
| Aplikacje do skanowania telefonem | Szybkie wykonanie nowego skanu | Zniekształcenie perspektywy może pogorszyć OCR. |
W przypadku prywatnych umów, dokumentacji medycznej, dokumentów finansowych, niepublikowanych rękopisów lub recenzowanych prac naukowych wybierz lokalny workflow OCR albo zaufane środowisko. Nie przesyłaj wrażliwych skanów do przypadkowych darmowych serwisów OCR.
Krok 4: Sprawdź tekst z OCR
Sprawdzaj przed tłumaczeniem, nie po nim. Skopiuj tekst z kilku trudnych stron i oceń, czy jest czytelny.
Przykładowe strony do sprawdzenia:
- Strona tytułowa.
- Gęsto zadrukowana strona głównej treści.
- Strona z tabelą.
- Strona z przypisami.
- Strona z małym drukiem.
- Strona ze stemplami, odręcznym pismem lub notatkami na marginesie.
- Strona w każdym języku, jeśli dokument jest wielojęzyczny.
Szukaj:
- Brakujących akapitów.
- Scalonych kolumn.
- Rozbitych słów.
- Nieprawidłowych znaków.
- Utraconych znaków diakrytycznych.
- Etykiet tabel oddzielonych od wartości.
- Nagłówków wstawionych do treści głównej.
- Numerów stron wmieszanych w zdania.
Jeśli jakość OCR jest słaba, popraw to przed tłumaczeniem. Tłumacz nie jest w stanie wiarygodnie odzyskać znaczenia, którego OCR nigdy nie uchwycił.
Krok 5: Przetłumacz plik PDF po przetworzeniu OCR
Gdy plik PDF ma już czystą warstwę tekstową, prześlij go do Tłumacza PDF. Etap tłumaczenia może teraz pracować na tekście zamiast na obrazach stron.
Po tłumaczeniu porównaj:
- Oryginalny skan
- Warstwę tekstową OCR
- Przetłumaczony plik PDF
Taka trójetapowa kontrola pomaga ustalić, czy błąd pochodzi z OCR, czy z tłumaczenia. Jeśli tekst OCR jest błędny, uruchom OCR ponownie. Jeśli tekst OCR jest poprawny, ale tłumaczenie jest błędne, popraw tłumaczenie.
Krok 6: Sprawdź treści wysokiego ryzyka
Zeskanowane dokumenty często zawierają właśnie te treści, które wymagają szczególnie uważnej kontroli: stare umowy, formularze urzędowe, artykuły naukowe, instrukcje, dokumenty historyczne i strony książek.
Sprawdź ręcznie te elementy:
- Nazwy własne
- Daty
- Liczby
- Adresy
- Kody produktów
- Odwołania prawne
- Cytowania
- Etykiety tabel
- Jednostki
- Równania
- Podpisy
- Przypisy
W przypadku materiałów badawczych i akademickich przeczytaj też poradnik o tłumaczeniu naukowych artykułów badawczych, ponieważ zeskanowane akademickie pliki PDF dodają ryzyko związane z cytowaniami i układem oprócz samego ryzyka OCR.
Przykłady typowych błędów
Korzystaj z tej tabeli podczas sprawdzania wyników OCR.
| Oryginalny skan prawdopodobnie pokazuje | Błędny wynik OCR | Dlaczego to ma znaczenie |
|---|---|---|
modern | modem | Znaczenie zmienia się całkowicie. |
Section 10 | Section IO | Odwołania prawne lub techniczne mogą stać się błędne. |
2026 | 2O26 | Daty i identyfikatory stają się niewiarygodne. |
patient | patlent | Terminy medyczne lub techniczne stają się błędne. |
| Dwie oddzielne kolumny | Jeden scalony akapit | Tłumaczenie odczytuje zdania w niewłaściwej kolejności. |
| Wiersz tabeli z etykietami i wartościami | Jedna linia wymieszanego tekstu | Dane przestają odpowiadać właściwej etykiecie. |
Znacznik przypisu 1 | Litera l | Uwagi mogą zostać przypisane do niewłaściwego zdania. |
Jeśli widzisz takie błędy w warstwie OCR, popraw OCR przed tłumaczeniem.
Którego narzędzia użyć?
Wybieraj na podstawie trudności dokumentu.
| Dokument | Zalecana ścieżka |
|---|---|
| Czysty skan biznesowy | OCR w Acrobat albo innym niezawodnym narzędziu OCR, a następnie Tłumacz PDF. |
| Skan starej książki | Wyprostuj obraz i popraw kontrast, starannie wykonaj OCR, a potem tłumacz. |
| Skan artykułu naukowego | OCR, sprawdzenie równań/cytowań/tabel, a następnie tłumaczenie z kontrolą układu. |
| Odręczne notatki | Przed tłumaczeniem może być potrzebna ręczna transkrypcja. |
| Prosty dokument osobisty | OCR online może być akceptowalny, jeśli ryzyko dla prywatności jest niskie. |
| Dokument wrażliwy | Użyj lokalnego OCR albo zaufanego, kontrolowanego workflow. |
Jeśli chcesz szerszego porównania narzędzi, zobacz przewodnik po najlepszych narzędziach do tłumaczenia PDF.
Typowe problemy ze zeskanowanymi plikami PDF
Strony o niskiej rozdzielczości
Skany o niskiej rozdzielczości zlewają litery ze sobą. OCR może mylić rn z m, cl z d albo interpunkcję z drobinami kurzu.
Rozwiązanie: jeśli to możliwe, zeskanuj dokument ponownie. Jeśli nie, zwiększ kontrast i spróbuj OCR jeszcze raz.
Przekrzywione lub zakrzywione strony
Skany książek często zakrzywiają się przy grzbiecie. OCR słabo odczytuje takie zakrzywione linie i może przestawiać tekst.
Rozwiązanie: wyprostuj stronę, zeskanuj ją ponownie albo użyj narzędzia OCR z funkcjami prostowania i korekcji zniekształceń.
Układ wielokolumnowy
OCR może scalać lewą i prawą kolumnę w jeden ciąg zdań.
Rozwiązanie: przed tłumaczeniem sprawdź kolejność odczytu. Artykuły naukowe wymagają tu szczególnej uwagi.
Tabele
Tabele są trudne, ponieważ OCR musi rozpoznać zarówno tekst, jak i strukturę. Tabela może wyglądać poprawnie wizualnie, a jednocześnie mieć błędną warstwę tekstową.
Rozwiązanie: skopiuj tekst OCR z tabeli i potwierdź, że etykiety nadal odpowiadają wartościom.
Pismo odręczne i podpisy
OCR drukowanego tekstu jest znacznie bardziej niezawodny niż rozpoznawanie pisma odręcznego. Odręczne notatki na marginesie, podpisy i wypełnione formularze mogą zostać pominięte albo zniekształcone.
Rozwiązanie: ręcznie przepisz istotne fragmenty pisma odręcznego przed tłumaczeniem.
Mieszane języki
OCR działa najlepiej, gdy zna język źródłowy. Skan zawierający angielski, francuski i chiński może się nie udać, jeśli OCR ustawiono tylko na jeden język.
Rozwiązanie: wybierz wszystkie odpowiednie języki OCR, jeśli narzędzie to obsługuje, a potem wyrywkowo sprawdź każdą sekcję językową.
Lista kontrolna prywatności i bezpieczeństwa
Zanim prześlesz zeskanowany plik PDF gdziekolwiek, zadaj sobie pytania:
- Czy dokument zawiera dane osobowe?
- Czy obejmuje materiały medyczne, prawne, finansowe, akademickie lub niepublikowane?
- Czy podlega umowie z klientem albo polityce szkoły lub uczelni?
- Czy dla tego dokumentu dozwolona jest usługa OCR online?
- Czy zamiast tego potrzebujesz lokalnego workflow?
- Czy możesz usunąć strony, które nie wymagają tłumaczenia?
Zeskanowane pliki PDF są często wrażliwe, ponieważ pochodzą z umów, dokumentów tożsamości, formularzy, szkiców badań i wewnętrznych archiwów. Traktuj decyzję o przesłaniu do OCR tak samo, jak traktowałbyś oryginalny dokument.
FAQ
Jak przetłumaczyć zeskanowany plik PDF?
Najpierw uruchom OCR, aby utworzyć warstwę tekstową, sprawdź wynik OCR, a następnie przetłumacz plik PDF po OCR za pomocą Tłumacza PDF. Nie pomijaj etapu sprawdzania OCR.
Dlaczego Google Translate nie przetłumaczył mojego zeskanowanego pliku PDF?
Plik PDF może zawierać wyłącznie obrazy. Jeśli nie ma warstwy tekstowej, Google Translate nie ma z czego wyodrębnić tekstu. Najpierw użyj OCR, a dopiero potem tłumacz. Proces specyficzny dla Google opisano w przewodniku po tłumaczeniu PDF w Google Translate.
Czy ChatGPT może przetłumaczyć zeskanowany plik PDF?
ChatGPT może pomóc przy pojedynczych obrazach albo wyodrębnionym tekście, ale wielostronicowy zeskanowany plik PDF nadal wymaga OCR i kontroli. W przypadku pełnego workflow dokumentu najpierw wykonaj OCR, a potem skorzystaj z workflow tłumaczenia PDF.
Jakie narzędzie OCR jest najlepsze do zeskanowanych plików PDF?
To zależy od dokumentu. Acrobat i narzędzia w stylu ABBYY sprawdzają się przy ogólnych i złożonych skanach. Tesseract lub OCRmyPDF są przydatne w lokalnych, technicznych workflow. OCR online może być w porządku przy prostych plikach o niskim ryzyku, ale prywatność i jakość bywają różne.
Czy OCR może zachować formatowanie?
OCR może utworzyć warstwę tekstową i czasem odtworzyć kolejność odczytu, ale to nie to samo co zachowanie oryginalnego układu po tłumaczeniu. Po OCR użyj workflow tłumaczenia PDF i porównaj wynik z oryginałem.
Co zrobić, jeśli jakość OCR jest słaba?
Popraw skan przed tłumaczeniem. Jeśli to możliwe, zeskanuj dokument ponownie, wyprostuj strony, zwiększ kontrast, przytnij zbędne elementy, wybierz właściwy język OCR i jeszcze raz sprawdź trudne strony.
Powiązane wpisy





