BookTranslator
BookTranslator

Jak przetłumaczyć zeskanowany plik PDF: kompletny przewodnik po OCR i tłumaczeniu

Zeskanowane pliki PDF zawierają obrazy tekstu, a nie prawdziwy tekst — dlatego Google Translate zwraca je bez zmian. Oto proces OCR + AI, który to naprawia.

BookTranslator

BookTranslator Team

10 min read

Szybka odpowiedź: zeskanowany PDF wymaga OCR przed tłumaczeniem

Aby przetłumaczyć zeskanowany plik PDF, najpierw uruchom OCR, aby zamienić obrazy stron w tekst, który można zaznaczać. Następnie przetłumacz plik PDF po przetworzeniu OCR za pomocą tłumacza dokumentów, takiego jak Tłumacz PDF. Jeśli pominiesz OCR, wiele narzędzi do tłumaczenia zwróci oryginalny plik bez zmian, pominie niektóre strony albo przetłumaczy tylko te fragmenty, które już zawierają warstwę tekstową.

Użyj tego procesu:

  1. Otwórz plik PDF i spróbuj zaznaczyć jedno zdanie.
  2. Jeśli nie możesz zaznaczyć tekstu, uruchom OCR.
  3. Przed tłumaczeniem sprawdź tekst z OCR.
  4. Prześlij plik PDF po OCR do Tłumacza PDF.
  5. Porównaj przetłumaczony wynik z oryginalnym skanem.

Jeśli Twój PDF ma już tekst możliwy do zaznaczania, a problem dotyczy zachowania układu, skorzystaj z poradnika, jak przetłumaczyć PDF bez utraty formatowania.

Dlaczego zeskanowane pliki PDF nie działają w narzędziach do tłumaczenia

Zeskanowany plik PDF to często po prostu zestaw obrazów stron zamkniętych w kontenerze PDF. Dla człowieka strona może wyglądać jak tekst, ale plik może nie zawierać rzeczywistego tekstu, który oprogramowanie potrafi wyodrębnić.

To prowadzi do prostego problemu:

Typ plikuCo widzi tłumaczCo się dzieje
PDF oparty na tekścieTekst plus dane układuTłumaczenie może zacząć się od razu.
Zeskanowany PDF zawierający wyłącznie obrazyObrazy stronNajpierw wymagany jest OCR.
PDF z tekstem na obrazieObraz skanu plus ukryta warstwa tekstowa OCRTłumaczenie może działać, ale błędy OCR wpływają na jakość.

Najbardziej użyteczny test nie jest techniczny:

  1. Otwórz plik PDF.
  2. Spróbuj zaznaczyć pojedyncze słowa.
  3. Skopiuj jedno zdanie.
  4. Wklej je do edytora tekstu.

Jeśli zdanie wkleja się poprawnie, plik PDF ma warstwę tekstową. Jeśli nie wkleja się nic albo cała strona zachowuje się jak jeden obraz, plik PDF wymaga OCR.

OCR nie jest opcjonalny

OCR oznacza optyczne rozpoznawanie znaków. Odczytuje tekst z obrazu i tworzy tekst czytelny dla komputera. W przypadku tłumaczenia PDF OCR zwykle tworzy niewidoczną warstwę tekstową na zeskanowanej stronie.

Ta warstwa tekstowa staje się źródłem tłumaczenia. Jeśli OCR popełnia błędy, tłumaczenie przejmuje te błędy.

Typowe błędy OCR:

Błąd OCRRyzyko dla tłumaczenia
rn odczytane jako mSłowa zmieniają znaczenie.
1 odczytane jako lBłędne stają się liczby, odwołania lub kody.
O odczytane jako 0Identyfikatory, wzory i nazwy mogą zostać zniekształcone.
Pominięte znaki diakrytyczneNazwy i terminy stają się niedokładne.
Scalanie kolumnZdania są tłumaczone w złej kolejności.
Komórki tabeli odczytane nieprawidłowo wiersz po wierszuEtykiety danych przestają odpowiadać wartościom.
Przypisy potraktowane jako tekst głównyCytowania i uwagi trafiają do niewłaściwego kontekstu.

Dlatego etap sprawdzania OCR ma znaczenie. Nie tłumacz zeskanowanego dokumentu, dopóki nie sprawdzisz wyrywkowo wyodrębnionego tekstu.

Proces pracy: najpierw OCR

Krok 1: Określ typ pliku PDF

Spróbuj zaznaczyć tekst. Jeśli zaznaczanie działa, OCR może nie być potrzebny. Jeśli zaznaczanie się nie powiedzie, traktuj plik jako zawierający wyłącznie obrazy.

Przyjrzyj się też stronie wizualnie:

  • Przekrzywione strony sugerują skan.
  • Szara faktura papieru sugeruje skan.
  • Cienie przy grzbiecie sugerują sfotografowaną książkę.
  • Nierówny kontrast sugeruje kserokopię.
  • Jeśli wyszukiwanie nie znajduje widocznych słów, prawdopodobnie nie ma warstwy tekstowej.

Krok 2: Popraw skan, jeśli to możliwe

Jakość OCR zaczyna się od jakości obrazu. Jeśli możesz zeskanować dokument ponownie, zrób to, zanim poświęcisz czas na poprawianie błędów OCR.

Skorzystaj z tej listy kontrolnej jakości obrazu:

  • Skanuj w rozdzielczości wystarczającej dla drobnego tekstu.
  • Utrzymuj strony płasko i prosto.
  • Unikaj cieni przy grzbiecie.
  • Przytnij krawędzie stołu, palce i zbędne elementy tła.
  • Zadbaj o wyraźny kontrast między tekstem a stroną.
  • Upewnij się, że cała linia jest widoczna.
  • Użyj prawidłowej orientacji strony.
  • Nie kompresuj obrazu tak mocno, aby litery się rozmazały.

W przypadku starych książek i kserokopii największą poprawę zwykle dają prostowanie obrazu, korekcja kontrastu i ponowne skanowanie stron, które są nieostre.

Krok 3: Uruchom OCR

Wybieraj narzędzie OCR na podstawie dokumentu, a nie marki.

Opcja OCRNajlepsze zastosowanieUważaj na
OCR w Adobe AcrobatTypowe skany biznesowe i porządkowanie PDF-ówZanim na nim polegasz, sprawdź dostęp w aktualnym planie.
ABBYY FineReaderZłożone skany, tabele, kolumny i trudne układyNadal wymaga ręcznej kontroli.
Tesseract lub OCRmyPDFLokalny, techniczny i powtarzalny workflow OCRWymaga swobody w pracy z narzędziami wiersza poleceń.
Narzędzia OCR onlineSporadyczne pliki o niskim ryzykuRóżnią się prywatnością, limitami plików i jakością.
Aplikacje do skanowania telefonemSzybkie wykonanie nowego skanuZniekształcenie perspektywy może pogorszyć OCR.

W przypadku prywatnych umów, dokumentacji medycznej, dokumentów finansowych, niepublikowanych rękopisów lub recenzowanych prac naukowych wybierz lokalny workflow OCR albo zaufane środowisko. Nie przesyłaj wrażliwych skanów do przypadkowych darmowych serwisów OCR.

Krok 4: Sprawdź tekst z OCR

Sprawdzaj przed tłumaczeniem, nie po nim. Skopiuj tekst z kilku trudnych stron i oceń, czy jest czytelny.

Przykładowe strony do sprawdzenia:

  • Strona tytułowa.
  • Gęsto zadrukowana strona głównej treści.
  • Strona z tabelą.
  • Strona z przypisami.
  • Strona z małym drukiem.
  • Strona ze stemplami, odręcznym pismem lub notatkami na marginesie.
  • Strona w każdym języku, jeśli dokument jest wielojęzyczny.

Szukaj:

  • Brakujących akapitów.
  • Scalonych kolumn.
  • Rozbitych słów.
  • Nieprawidłowych znaków.
  • Utraconych znaków diakrytycznych.
  • Etykiet tabel oddzielonych od wartości.
  • Nagłówków wstawionych do treści głównej.
  • Numerów stron wmieszanych w zdania.

Jeśli jakość OCR jest słaba, popraw to przed tłumaczeniem. Tłumacz nie jest w stanie wiarygodnie odzyskać znaczenia, którego OCR nigdy nie uchwycił.

Krok 5: Przetłumacz plik PDF po przetworzeniu OCR

Gdy plik PDF ma już czystą warstwę tekstową, prześlij go do Tłumacza PDF. Etap tłumaczenia może teraz pracować na tekście zamiast na obrazach stron.

Po tłumaczeniu porównaj:

  • Oryginalny skan
  • Warstwę tekstową OCR
  • Przetłumaczony plik PDF

Taka trójetapowa kontrola pomaga ustalić, czy błąd pochodzi z OCR, czy z tłumaczenia. Jeśli tekst OCR jest błędny, uruchom OCR ponownie. Jeśli tekst OCR jest poprawny, ale tłumaczenie jest błędne, popraw tłumaczenie.

Krok 6: Sprawdź treści wysokiego ryzyka

Zeskanowane dokumenty często zawierają właśnie te treści, które wymagają szczególnie uważnej kontroli: stare umowy, formularze urzędowe, artykuły naukowe, instrukcje, dokumenty historyczne i strony książek.

Sprawdź ręcznie te elementy:

  • Nazwy własne
  • Daty
  • Liczby
  • Adresy
  • Kody produktów
  • Odwołania prawne
  • Cytowania
  • Etykiety tabel
  • Jednostki
  • Równania
  • Podpisy
  • Przypisy

W przypadku materiałów badawczych i akademickich przeczytaj też poradnik o tłumaczeniu naukowych artykułów badawczych, ponieważ zeskanowane akademickie pliki PDF dodają ryzyko związane z cytowaniami i układem oprócz samego ryzyka OCR.

Przykłady typowych błędów

Korzystaj z tej tabeli podczas sprawdzania wyników OCR.

Oryginalny skan prawdopodobnie pokazujeBłędny wynik OCRDlaczego to ma znaczenie
modernmodemZnaczenie zmienia się całkowicie.
Section 10Section IOOdwołania prawne lub techniczne mogą stać się błędne.
20262O26Daty i identyfikatory stają się niewiarygodne.
patientpatlentTerminy medyczne lub techniczne stają się błędne.
Dwie oddzielne kolumnyJeden scalony akapitTłumaczenie odczytuje zdania w niewłaściwej kolejności.
Wiersz tabeli z etykietami i wartościamiJedna linia wymieszanego tekstuDane przestają odpowiadać właściwej etykiecie.
Znacznik przypisu 1Litera lUwagi mogą zostać przypisane do niewłaściwego zdania.

Jeśli widzisz takie błędy w warstwie OCR, popraw OCR przed tłumaczeniem.

Którego narzędzia użyć?

Wybieraj na podstawie trudności dokumentu.

DokumentZalecana ścieżka
Czysty skan biznesowyOCR w Acrobat albo innym niezawodnym narzędziu OCR, a następnie Tłumacz PDF.
Skan starej książkiWyprostuj obraz i popraw kontrast, starannie wykonaj OCR, a potem tłumacz.
Skan artykułu naukowegoOCR, sprawdzenie równań/cytowań/tabel, a następnie tłumaczenie z kontrolą układu.
Odręczne notatkiPrzed tłumaczeniem może być potrzebna ręczna transkrypcja.
Prosty dokument osobistyOCR online może być akceptowalny, jeśli ryzyko dla prywatności jest niskie.
Dokument wrażliwyUżyj lokalnego OCR albo zaufanego, kontrolowanego workflow.

Jeśli chcesz szerszego porównania narzędzi, zobacz przewodnik po najlepszych narzędziach do tłumaczenia PDF.

Typowe problemy ze zeskanowanymi plikami PDF

Strony o niskiej rozdzielczości

Skany o niskiej rozdzielczości zlewają litery ze sobą. OCR może mylić rn z m, cl z d albo interpunkcję z drobinami kurzu.

Rozwiązanie: jeśli to możliwe, zeskanuj dokument ponownie. Jeśli nie, zwiększ kontrast i spróbuj OCR jeszcze raz.

Przekrzywione lub zakrzywione strony

Skany książek często zakrzywiają się przy grzbiecie. OCR słabo odczytuje takie zakrzywione linie i może przestawiać tekst.

Rozwiązanie: wyprostuj stronę, zeskanuj ją ponownie albo użyj narzędzia OCR z funkcjami prostowania i korekcji zniekształceń.

Układ wielokolumnowy

OCR może scalać lewą i prawą kolumnę w jeden ciąg zdań.

Rozwiązanie: przed tłumaczeniem sprawdź kolejność odczytu. Artykuły naukowe wymagają tu szczególnej uwagi.

Tabele

Tabele są trudne, ponieważ OCR musi rozpoznać zarówno tekst, jak i strukturę. Tabela może wyglądać poprawnie wizualnie, a jednocześnie mieć błędną warstwę tekstową.

Rozwiązanie: skopiuj tekst OCR z tabeli i potwierdź, że etykiety nadal odpowiadają wartościom.

Pismo odręczne i podpisy

OCR drukowanego tekstu jest znacznie bardziej niezawodny niż rozpoznawanie pisma odręcznego. Odręczne notatki na marginesie, podpisy i wypełnione formularze mogą zostać pominięte albo zniekształcone.

Rozwiązanie: ręcznie przepisz istotne fragmenty pisma odręcznego przed tłumaczeniem.

Mieszane języki

OCR działa najlepiej, gdy zna język źródłowy. Skan zawierający angielski, francuski i chiński może się nie udać, jeśli OCR ustawiono tylko na jeden język.

Rozwiązanie: wybierz wszystkie odpowiednie języki OCR, jeśli narzędzie to obsługuje, a potem wyrywkowo sprawdź każdą sekcję językową.

Lista kontrolna prywatności i bezpieczeństwa

Zanim prześlesz zeskanowany plik PDF gdziekolwiek, zadaj sobie pytania:

  • Czy dokument zawiera dane osobowe?
  • Czy obejmuje materiały medyczne, prawne, finansowe, akademickie lub niepublikowane?
  • Czy podlega umowie z klientem albo polityce szkoły lub uczelni?
  • Czy dla tego dokumentu dozwolona jest usługa OCR online?
  • Czy zamiast tego potrzebujesz lokalnego workflow?
  • Czy możesz usunąć strony, które nie wymagają tłumaczenia?

Zeskanowane pliki PDF są często wrażliwe, ponieważ pochodzą z umów, dokumentów tożsamości, formularzy, szkiców badań i wewnętrznych archiwów. Traktuj decyzję o przesłaniu do OCR tak samo, jak traktowałbyś oryginalny dokument.

FAQ

Jak przetłumaczyć zeskanowany plik PDF?

Najpierw uruchom OCR, aby utworzyć warstwę tekstową, sprawdź wynik OCR, a następnie przetłumacz plik PDF po OCR za pomocą Tłumacza PDF. Nie pomijaj etapu sprawdzania OCR.

Dlaczego Google Translate nie przetłumaczył mojego zeskanowanego pliku PDF?

Plik PDF może zawierać wyłącznie obrazy. Jeśli nie ma warstwy tekstowej, Google Translate nie ma z czego wyodrębnić tekstu. Najpierw użyj OCR, a dopiero potem tłumacz. Proces specyficzny dla Google opisano w przewodniku po tłumaczeniu PDF w Google Translate.

Czy ChatGPT może przetłumaczyć zeskanowany plik PDF?

ChatGPT może pomóc przy pojedynczych obrazach albo wyodrębnionym tekście, ale wielostronicowy zeskanowany plik PDF nadal wymaga OCR i kontroli. W przypadku pełnego workflow dokumentu najpierw wykonaj OCR, a potem skorzystaj z workflow tłumaczenia PDF.

Jakie narzędzie OCR jest najlepsze do zeskanowanych plików PDF?

To zależy od dokumentu. Acrobat i narzędzia w stylu ABBYY sprawdzają się przy ogólnych i złożonych skanach. Tesseract lub OCRmyPDF są przydatne w lokalnych, technicznych workflow. OCR online może być w porządku przy prostych plikach o niskim ryzyku, ale prywatność i jakość bywają różne.

Czy OCR może zachować formatowanie?

OCR może utworzyć warstwę tekstową i czasem odtworzyć kolejność odczytu, ale to nie to samo co zachowanie oryginalnego układu po tłumaczeniu. Po OCR użyj workflow tłumaczenia PDF i porównaj wynik z oryginałem.

Co zrobić, jeśli jakość OCR jest słaba?

Popraw skan przed tłumaczeniem. Jeśli to możliwe, zeskanuj dokument ponownie, wyprostuj strony, zwiększ kontrast, przytnij zbędne elementy, wybierz właściwy język OCR i jeszcze raz sprawdź trudne strony.

Powiązane wpisy