Menerjemahkan PDF Pindai: Masalah OCR dan Solusi Praktis
Pelajari cara melakukan OCR dan menerjemahkan PDF pindai, mendiagnosis kegagalan pengenalan umum, dan mempertahankan tata letak dengan alur kerja yang sadar dokumen.

Jawaban Cepat: PDF Pindai Memerlukan OCR Sebelum Diterjemahkan
Untuk menerjemahkan PDF pindai, jalankan OCR terlebih dahulu untuk mengubah gambar halaman menjadi teks yang dapat dipilih. Kemudian terjemahkan PDF yang telah diproses OCR dengan penerjemah dokumen seperti PDF Translator. Jika Anda melewati OCR, banyak alat penerjemah akan mengembalikan file asli tanpa perubahan, melewatkan halaman, atau hanya menerjemahkan bagian yang sudah berisi lapisan teks.
Gunakan alur kerja ini:
- Buka PDF dan coba pilih sebuah kalimat.
- Jika Anda tidak dapat memilih teks, jalankan OCR.
- Tinjau teks OCR sebelum menerjemahkan.
- Unggah PDF yang telah diproses OCR ke PDF Translator.
- Tinjau hasil terjemahan terhadap pemindaian asli.
Jika PDF Anda sudah memiliki teks yang dapat dipilih dan masalahnya adalah pelestarian tata letak, gunakan panduan untuk menerjemahkan PDF tanpa kehilangan pemformatan.
Mengapa PDF Pindai Gagal dalam Alat Terjemahan
PDF pindai sering kali hanya berupa sekumpulan gambar halaman di dalam wadah PDF. Halaman tersebut mungkin menampilkan kata-kata kepada manusia, tetapi file tersebut mungkin tidak berisi teks aktual untuk diekstrak oleh perangkat lunak.
Hal itu menciptakan kegagalan sederhana:
| Jenis file | Apa yang dilihat penerjemah | Apa yang terjadi |
|---|---|---|
| PDF berbasis teks | Teks ditambah data tata letak | Terjemahan dapat langsung dimulai. |
| PDF pindai khusus gambar | Gambar halaman | OCR diperlukan terlebih dahulu. |
| PDF teks di atas gambar | Gambar pemindaian ditambah lapisan teks OCR tersembunyi | Terjemahan dapat berfungsi, tetapi kesalahan OCR memengaruhi kualitas. |
Uji yang paling berguna bukanlah uji teknis:
- Buka PDF.
- Coba sorot kata individual.
- Salin sebuah kalimat.
- Tempel ke editor teks.
Jika kalimat tersebut menempel dengan benar, PDF memiliki lapisan teks. Jika tidak ada yang menempel, atau seluruh halaman berperilaku seperti satu gambar, PDF memerlukan OCR.
OCR Bukanlah Opsional
OCR singkatan dari pengenalan karakter optik (optical character recognition). OCR membaca teks dari gambar dan membuat teks yang dapat dibaca mesin. Untuk terjemahan PDF, OCR biasanya membuat lapisan teks tak terlihat di atas halaman yang dipindai.
Lapisan teks tersebut menjadi sumber terjemahan. Jika OCR membuat kesalahan, terjemahan akan mewarisi kesalahan tersebut.
Kesalahan OCR yang umum:
| Kesalahan OCR | Risiko terjemahan |
|---|---|
rn terbaca sebagai m | Kata-kata berubah makna. |
1 terbaca sebagai l | Angka, referensi, atau kode menjadi salah. |
O terbaca sebagai 0 | ID, rumus, dan nama dapat rusak. |
| Aksen dihilangkan | Nama dan istilah menjadi tidak akurat. |
| Kolom digabung | Kalimat diterjemahkan dengan urutan yang salah. |
| Sel tabel dibaca baris demi baris secara tidak benar | Label data tidak lagi cocok dengan nilai. |
| Catatan kaki diperlakukan sebagai teks tubuh | Kutipan dan catatan berpindah ke konteks yang salah. |
Inilah sebabnya mengapa langkah peninjauan OCR penting. Jangan menerjemahkan dokumen pindai sampai Anda memeriksa secara acak teks yang diekstrak.
Alur Kerja Berbasis OCR
Langkah 1: Identifikasi Jenis PDF
Coba pilih teks. Jika pemilihan berhasil, Anda mungkin tidak memerlukan OCR. Jika pemilihan gagal, perlakukan file sebagai khusus gambar.
Periksa juga halaman secara visual:
- Halaman yang miring menunjukkan hasil pemindaian.
- Tekstur kertas abu-abu menunjukkan hasil pemindaian.
- Bayangan di dekat lipatan buku menunjukkan buku yang difoto.
- Kontras yang tidak merata menunjukkan fotokopi.
- Pencarian yang tidak menemukan kata-kata yang terlihat menunjukkan tidak ada lapisan teks.
Langkah 2: Tingkatkan Kualitas Pemindaian Jika Memungkinkan
Kualitas OCR dimulai dari kualitas gambar. Jika Anda dapat memindai ulang, lakukan sebelum menghabiskan waktu memperbaiki kesalahan OCR.
Gunakan daftar periksa kualitas gambar ini:
- Pindai pada resolusi yang cukup tinggi untuk teks kecil.
- Jaga halaman tetap datar dan lurus.
- Hindari bayangan di dekat lipatan buku.
- Pangkas tepi meja, jari, atau kekacauan latar belakang.
- Gunakan kontras yang kuat antara teks dan halaman.
- Jaga agar seluruh baris tetap terlihat.
- Gunakan orientasi halaman yang benar.
- Jangan kompres gambar terlalu berat hingga huruf menjadi buram.
Untuk buku lama dan fotokopi, peningkatan terbesar biasanya berasal dari pelurusan (deskewing), koreksi kontras, dan pemindaian ulang halaman yang keluar fokus.
Langkah 3: Jalankan OCR
Pilih alat OCR berdasarkan dokumen, bukan mereknya.
| Opsi OCR | Terbaik untuk | Hal yang perlu diwaspadai |
|---|---|---|
| Adobe Acrobat OCR | Pemindaian bisnis umum dan pembersihan PDF | Periksa akses paket saat ini sebelum mengandalkannya. |
| ABBYY FineReader | Pemindaian kompleks, tabel, kolom, dan tata letak yang sulit | Masih memerlukan peninjauan manual. |
| Tesseract atau OCRmyPDF | Alur kerja OCR lokal, teknis, dan dapat diulang | Memerlukan kenyamanan dengan alat baris perintah (command-line). |
| Alat OCR online | File sesekali berisiko rendah | Privasi, batas file, dan kualitas bervariasi. |
| Aplikasi pemindai ponsel | Menangkap pemindaian baru dengan cepat | Distorsi perspektif dapat merusak OCR. |
Untuk kontrak pribadi, catatan medis, dokumen keuangan, naskah yang belum diterbitkan, atau karya akademik yang sedang ditinjau, lebih disukai alur kerja OCR lokal atau lingkungan tepercaya. Jangan unggah pemindaian sensitif ke situs OCR gratis sembarangan.
Langkah 4: Tinjau Teks OCR
Tinjau sebelum menerjemahkan, bukan sesudahnya. Salin teks dari beberapa halaman yang sulit dan periksa apakah teks tersebut dapat dibaca.
Contoh halaman yang perlu diperiksa:
- Halaman judul.
- Halaman isi yang padat.
- Halaman tabel.
- Halaman dengan catatan kaki.
- Halaman dengan teks kecil.
- Halaman dengan stempel, tulisan tangan, atau catatan marjin.
- Halaman dalam setiap bahasa jika dokumen tersebut multibahasa.
Cari:
- Paragraf yang hilang.
- Kolom yang digabung.
- Kata-kata yang terputus.
- Karakter yang salah.
- Diakritik yang hilang.
- Label tabel terpisah dari nilai.
- Header disisipkan ke dalam teks tubuh.
- Nomor halaman tercampur ke dalam kalimat.
Jika kualitas OCR buruk, perbaiki sebelum diterjemahkan. Penerjemah tidak dapat memulihkan makna secara andal yang tidak pernah ditangkap oleh OCR.
Langkah 5: Terjemahkan PDF yang Telah Diproses OCR
Setelah PDF memiliki lapisan teks yang bersih, unggah ke PDF Translator. Langkah terjemahan sekarang dapat bekerja dengan teks alih-alih gambar halaman.
Setelah diterjemahkan, bandingkan:
- Pemindaian asli
- Lapisan teks OCR
- PDF terjemahan
Peninjauan tiga arah ini membantu Anda mengidentifikasi apakah suatu kesalahan berasal dari OCR atau terjemahan. Jika teks OCR salah, jalankan ulang OCR. Jika teks OCR benar tetapi terjemahannya salah, perbaiki terjemahannya.
Langkah 6: Tinjau Konten Berisiko Tinggi
Dokumen yang dipindai sering kali berisi konten yang memerlukan peninjauan cermat: kontrak lama, formulir pemerintah, makalah akademik, manual, dokumen sejarah, dan halaman buku.
Tinjau item-item ini secara manual:
- Nama
- Tanggal
- Angka
- Alamat
- Kode produk
- Referensi hukum
- Kutipan
- Label tabel
- Satuan
- Persamaan
- Keterangan gambar
- Catatan kaki
Untuk file penelitian dan akademik, baca juga panduan tentang menerjemahkan makalah penelitian akademik, karena PDF akademik yang dipindai menambah risiko kutipan dan tata letak di atas risiko OCR.
Contoh Kegagalan Berdampingan
Gunakan tabel ini saat meninjau keluaran OCR.
| Pemindaian asli kemungkinan menunjukkan | Keluaran OCR yang buruk | Mengapa hal itu penting |
|---|---|---|
modern | modem | Makna berubah sepenuhnya. |
Section 10 | Section IO | Referensi hukum atau teknis dapat rusak. |
2026 | 2O26 | Tanggal dan ID menjadi tidak dapat diandalkan. |
patient | patlent | Istilah medis atau teknis menjadi salah. |
| Dua kolom terpisah | Satu paragraf gabungan | Terjemahan membaca kalimat dengan urutan yang salah. |
| Baris tabel dengan label dan nilai | Satu baris teks campuran | Data tidak lagi cocok dengan label yang benar. |
Penanda catatan kaki 1 | Huruf l | Catatan dapat terlampir pada kalimat yang salah. |
Jika Anda melihat kesalahan ini pada lapisan OCR, perbaiki OCR sebelum menerjemahkan.
Alat Mana yang Harus Anda Gunakan?
Pilih berdasarkan tingkat kesulitan dokumen.
| Dokumen | Jalur yang disarankan |
|---|---|
| Pemindaian bisnis bersih | OCR di Acrobat atau alat OCR tepercaya lainnya, lalu PDF Translator. |
| Pemindaian buku lama | Luruskan dan tingkatkan kontras, OCR dengan cermat, lalu terjemahkan. |
| Pemindaian makalah akademik | OCR, tinjau persamaan/kutipan/tabel, lalu terjemahkan dengan peninjauan tata letak. |
| Catatan tulisan tangan | Transkripsi manual mungkin diperlukan sebelum diterjemahkan. |
| Dokumen pribadi sederhana | OCR online dapat diterima jika risiko privasi rendah. |
| Dokumen sensitif | Gunakan OCR lokal atau alur kerja terkontrol yang tepercaya. |
Jika Anda menginginkan perbandingan alat yang lebih luas, lihat panduan penerjemah PDF terbaik.
Masalah PDF Pindai yang Umum
Halaman Resolusi Rendah
Pemindaian beresolusi rendah membuat huruf-huruf menjadi kabur dan menyatu. OCR mungkin kebingungan membedakan rn dan m, cl dan d, atau tanda baca dan debu.
Solusi: pindai ulang jika memungkinkan. Jika tidak, tingkatkan kontras dan coba OCR lagi.
Halaman Miring atau Melengkung
Pemindaian buku sering kali melengkung di dekat lipatan buku. OCR membaca baris yang melengkung dengan buruk dan dapat mengurutkan ulang teks.
Solusi: ratakan halaman, pindai ulang, atau gunakan alat OCR dengan fitur pelurusan dan pelengkungan (deskew dan dewarping).
Tata Letak Multi-Kolom
OCR dapat menggabungkan kolom kiri dan kanan menjadi satu alur kalimat.
Solusi: periksa urutan baca sebelum menerjemahkan. Makalah akademik memerlukan perhatian khusus di sini.
Tabel
Tabel sulit diproses karena OCR harus mendeteksi teks dan struktur sekaligus. Tabel dapat terlihat benar secara visual sementara lapisan teksnya salah.
Solusi: salin teks OCR dari tabel dan pastikan label masih cocok dengan nilai.
Tulisan Tangan dan Tanda Tangan
OCR teks cetak jauh lebih andal daripada pengenalan tulisan tangan. Catatan marjin tulisan tangan, tanda tangan, dan formulir yang diisi mungkin terlewat atau rusak.
Solusi: transkripsikan tulisan tangan penting secara manual sebelum diterjemahkan.
Bahasa Campuran
OCR bekerja paling baik saat mengetahui bahasa sumber. Pemindaian dengan bahasa Inggris, Prancis, dan Mandarin dapat gagal jika OCR hanya disetel ke satu bahasa.
Solusi: pilih semua bahasa OCR yang relevan jika alat tersebut mendukungnya, lalu periksa secara acak setiap bagian bahasa.
Daftar Periksa Privasi dan Keamanan
Sebelum mengunggah PDF pindai ke mana pun, tanyakan:
- Apakah dokumen berisi data pribadi?
- Apakah dokumen tersebut mencakup materi medis, hukum, keuangan, akademik, atau yang belum diterbitkan?
- Apakah dokumen dilindungi oleh perjanjian klien atau kebijakan sekolah?
- Apakah layanan OCR online diizinkan untuk dokumen ini?
- Apakah Anda memerlukan alur kerja lokal sebagai gantinya?
- Bisakah Anda menghapus halaman yang tidak perlu diterjemahkan?
PDF pindai sering kali bersifat sensitif karena berasal dari kontrak, ID, formulir, draf penelitian, dan arsip internal. Perlakukan keputusan pengunggahan OCR dengan cara yang sama seperti Anda memperlakukan dokumen asli.
Artikel Terkait





