BookTranslator
BookTranslator

Salin-Tempel PDF Menghasilkan Teks yang Salah? Diagnosa Lapisan Teks Terlebih Dahulu

PDF mungkin terlihat benar tetapi menyalin kata atau angka yang salah. Gunakan empat file sampel untuk mengidentifikasi masalah lapisan teks dan pilih perbaikan yang dapat Anda verifikasi.

BookTranslator

BookTranslator Team

9 min read

Jika PDF terlihat benar tetapi menempelkan teks yang salah, berhentilah menggunakan versi tempel tersebut sebagai sumber Anda. Pertama-tama, bandingkan bagian pendek dengan halaman yang terlihat: sebuah nama, sebuah kalimat, dan sebuah angka. Langkah selanjutnya bergantung pada apakah file tersebut tidak memiliki teks yang dapat diekstrak, pemetaan karakter yang salah, lapisan OCR tersembunyi yang tidak akurat, atau masalah urutan baca. Menjalankan OCR pada seluruh dokumen bukanlah langkah awal yang tepat untuk keempat masalah tersebut.

Kesalahan yang paling berbahaya bukanlah teks acak. Melainkan teks yang masuk akal: halaman yang bertuliskan 18 buku catatan , sementara teks yang diekstrak bertuliskan 13 buku catatan. Kami membuat empat PDF yang dapat diunduh untuk membuat perbedaan tersebut terlihat, tanpa menggunakan dokumen pribadi siapa pun.

Mulai dengan pemeriksaan salin-dan-bandingkan yang singkat

Biarkan file asli tetap tidak berubah dan buka salinan kerja. Tempelkan satu pilihan pendek ke dalam editor teks biasa, lalu bandingkan karakter demi karakter dengan halaman tersebut. Ulangi pada halaman yang berbeda dan, jika tersedia, di pembaca PDF kedua. Ini adalah pemeriksaan diagnostik, bukan bukti bahwa sisa dokumen sudah benar.

Apa yang terjadiApa yang harus diselidikiTindakan pertama yang berguna
Tidak ada yang dapat dipilih, atau hasil tempel kosongHalaman mungkin hanya berisi gambarPeriksa apakah pembaca sedang memilih gambar halaman alih-alih teks
Huruf berubah secara konsisten, meskipun terlihat normal di halamanPengodean karakter atau pemetaan ekstraksiBandingkan keluaran pembaca lain; cari file sumber asli atau ekspor yang lebih baik
Sebagian besar kata dapat dibaca, tetapi nama atau angka salahLapisan teks yang tidak akurat, termasuk OCR lamaBandingkan bagian yang diekstrak dengan pindaian yang terlihat
Huruf benar, tetapi kolom, keterangan gambar, atau catatan kaki muncul dalam urutan yang salahEkstraksi tata letak dan urutan bacaUji satu kolom atau paragraf secara terpisah
Penyalinan dinonaktifkanIzin dokumen atau perilaku pembacaPeriksa izin file dan minta salinan yang dapat digunakan kepada sumbernya

Ini adalah petunjuk, bukan cara untuk mengidentifikasi bagian internal setiap PDF dari satu gejala. Panduan penggunaan kembali konten dari Adobe membedakan konten khusus gambar dari pembatasan penyalinan. Keduanya tidak boleh dianggap secara otomatis sebagai lapisan teks yang rusak. Panduan ekstraksi pypdf menjelaskan secara terpisah mengenai gambar, ekstraksi teks, serta kendala pada tabel dan spasi.

Untuk buku atau laporan panjang, catat nomor halaman PDF tempat setiap masalah terjadi. Halaman judul yang bersih tidak memberi tahu Anda apakah lampiran, sisipan hasil pindai, atau bab dua kolom akan tersalin dengan benar.

Empat PDF: apa yang ditampilkan halaman versus apa yang dikembalikan oleh ekstraksi

Halaman uji kami berisi empat baris asli, termasuk:

Arsip tersebut berisi 18 buku catatan.

Barang B-204 tiba pada 6 Mei.

Kami membuat satu PDF digital normal dan sengaja membuat tiga alternatif. Kemudian kami mengekstrak teksnya menggunakan Poppler dan pypdf. Kedua alat ekstraksi tersebut mengembalikan teks yang sama untuk setiap file dalam pengujian ini.

Unduh PDFBagaimana kami membuatnyaHasil ekstraksi aktual
Teks digital yang benarTeks yang dapat dilihat secara normal dengan font tersemat18 notebooks; B-204; 6 May
Pemetaan Unicode salahMengubah pemetaan ekstraksi tanpa mengubah bentuk huruf (glif) yang terlihat13 notebooks; beberapa karakter a huruf kecil menjadi x
Teks tersembunyi yang salahMenempatkan teks tak terlihat yang sengaja salah di atas gambar halaman13 notebooks; B-2O4; 8 May
Halaman hanya-gambarMenggunakan gambar halaman yang sama tanpa lapisan teksKeluaran teks kosong

Halaman digital yang tampak normal dapat disalin dengan salah

Dua PDF pertama dirender menjadi piksel yang identik dalam perbandingan kami, namun teks yang diekstrak berbeda. Pada berkas kedua, kami sengaja mengubah ToUnicode pemetaan: informasi yang digunakan untuk memetakan kode karakter tersimpan ke teks Unicode. Angka yang terlihat tetap 8, sementara ekstraksi mengembalikan 3. Dokumentasi CMap pypdf mengilustrasikan mekanisme pemetaan ini.

Ini menunjukkan salah satu mekanisme kegagalan, bukan klaim bahwa setiap PDF yang rusak memiliki cacat yang sama. Entri ToUnicode yang hilang saja bukanlah diagnosis kami, dan mengedit pemetaan secara manual bukanlah perbaikan umum yang menghadap pembaca.

Pindai yang dapat dicari dapat berisi kata-kata yang salah

PDF ketiga dan keempat juga dirender secara identik satu sama lain. Yang satu berisi teks tak terlihat yang salah; yang lainnya tidak berisi apa pun. Pada berkas ketiga, ekstraksi mengubah jumlah dan tanggal secara diam-diam. Kode B-2O4 berisi huruf O, bukan angka 0 yang ditampilkan pada gambar.

Kami menyisipkan kesalahan tersebut sendiri untuk merepresentasikan jenis ketidakcocokan yang dapat dikandung oleh lapisan teks tersembunyi. Mesin OCR tidak menghasilkan kesalahan tersebut. Berkas keempat menunjukkan kondisi sebaliknya: gambar halaman yang dapat dibaca tanpa ada apa pun untuk dikembalikan oleh ekstraktor teks ini. Hal tersebut konsisten dengan keterbatasan pypdf yang didokumentasikan: alat ini mengekstrak teks PDF yang sudah ada; alat ini tidak mengenali kata-kata di dalam gambar.

Apa yang dibuktikan oleh pengujian ini—dan apa yang tidak dibuktikannya

Pada 10 September 2026, kami memeriksa empat berkas satu halaman menggunakan Poppler 26.08.0 dan pypdf 6.10.0. Perbandingan visual menggunakan Poppler pada 144 dpi. Kesamaan piksel tetap terjaga di dalam kedua pasangan tersebut, bukan di seluruh keempat berkas: pasangan berbasis gambar melewati langkah perenderan tambahan.

Ini adalah demonstrasi terkendali, bukan tolok ukur akurasi OCR. Ini tidak menguji pengenalan multibahasa, tata letak yang kompleks, perbaikan Acrobat, perbaikan OCRmyPDF, atau unggahan BookTranslator. Ini adalah contoh yang dibuat dengan kesalahan yang diketahui, bukan penilaian buta.

Data teks mentah dan hasil piksel, instruksi reproduksi, dan generator tersedia bersama berkas-berkas tersebut. Semuanya menggunakan font Noto Sans yang tidak dimodifikasi dengan lisensi font terbuka yang disertakan.

Pilih langkah selanjutnya yang paling tidak mengganggu

Rute perbaikan berikut berasal dari dokumentasi resmi dan diagnosis praktis. Ini bukan hasil perbaikan dari eksperimen empat berkas kami. Kerjakan pada salinan dan verifikasi hasilnya sebelum mengganti apa pun yang Anda andalkan.

Jika Anda memiliki dokumen sumber, coba ekspor ulang terlebih dahulu

PDF baru dari berkas pengolah kata, penerbitan, atau penataan huruf asli adalah kandidat pertama yang berguna. Bandingkan bagian yang gagal secara tepat. Jangan berasumsi bahwa nama berkas baru atau ekspor yang berhasil berarti teksnya sekarang sudah benar.

Untuk materi yang diperoleh dari arsip atau penerbit, periksa apakah ada versi alternatif yang mengandung teks. Pastikan referensi edisi dan halaman tetap selaras: berkas yang lebih bersih dari edisi yang berbeda mungkin tidak mempertahankan bagian yang Anda butuhkan.

Jika hasil pemindaian memiliki beberapa kesalahan pengenalan, tinjau kata-kata tersebut

Acrobat mendokumentasikan alur kerja di bawah Scan & OCR → Correct recognized text. Ini memungkinkan Anda meninjau kata-kata mencurigakan yang ditandai terhadap gambar yang dipindai dan memperbaiki teks yang dikenali. Ikuti instruksi perbaikan terbaru dari Adobe untuk antarmuka pada versi Anda.

Jangan gunakan daftar kecurigaan yang kosong sebagai uji kelengkapan. Bandingkan secara mandiri nama, tanggal, pengidentifikasi, dan jumlah yang akan Anda kutip atau terjemahkan. Hasil kami yang sengaja disalahkan 13 notebooks contoh menunjukkan mengapa keluaran yang dapat dibaca saja belum cukup.

Jika teks tersembunyi secara garis besar salah, bedakan antara redo dan force

Bagi pembaca yang menggunakan perangkat baris perintah, OCRmyPDF mendokumentasikan berbagai jalur untuk halaman yang sudah berisi teks:

  • --redo-ocr menghapus teks OCR non-cetak yang ada dan mengenali ulang sekaligus mengecualikan teks cetak dari OCR.
  • --skip-text melewati halaman yang berisi teks. Itu bukanlah perbaikan untuk lapisan teks lama yang salah.
  • --force-ocr melakukan rasterisasi konten halaman dan menjalankan OCR pada gambar yang dihasilkan.

Perilaku ini dijelaskan dalam dokumentasi kesalahan teks-ada OCRmyPDF. Pada versi 17, pilihan yang setara juga tersedia melalui --mode; flag yang lebih lama tetap menjadi alias.

Ada biaya dan pengecualian. Redo tidak dapat mengidentifikasi setiap susunan OCR historis; beberapa file menempatkan gambar buram di atas teks yang secara teknis dapat dicetak. Force mengubah teks yang dapat dicetak dan konten vektor menjadi piksel serta meratakan konten interaktif. Redo dan force juga membuang pohon struktur yang ada daripada merekonstruksikannya. Tinjau dokumentasi tingkat lanjut OCRmyPDF sebelum memilih salah satunya.

Ekstrak yang diperbaiki karena itu bukanlah proses aksesibilitas. Jika dokumen memerlukan judul, urutan baca, atau gambar yang dapat diakses, gunakan pemeriksaan aksesibilitas PDF terjemahan.

terpisah

Jika halaman atau bahasa berbeda, jangan berasumsi satu pengaturan cocok untuk semuanya. Buat daftar halaman mana yang sudah berisi teks digital yang dapat dipercaya dan mana yang memerlukan pengenalan. Periksa bahasa pada halaman yang terkena dampak sebelum mengonfigurasi OCR. Panduan OCR PDF multibahasa kami mencakup pemilihan bahasa; itu adalah keputusan yang berbeda dari menentukan apakah lapisan teks lama salah.

Jika sama sekali tidak ada lapisan teks, lanjutkan ke alur kerja PDF yang dipindai. Berulang kali mencoba ekstraktor teks biasa yang lain tidak akan membuat pypdf mengenali kata-kata dalam gambar.

Verifikasi teks pengganti sebelum menggunakannya

Gunakan lembar periksa lapisan teks yang dapat diunduh untuk menjaga referensi visual, ekstraksi sebelumnya, dan ekstraksi pengganti tetap berdampingan. Mulailah dengan kegagalan yang diketahui, lalu uji bagian yang berbeda dan tata letak halaman yang jelas berbeda.

  1. Kata-kata: bandingkan nama dan istilah yang tidak dikenal huruf demi huruf.
  2. Angka: periksa kuantitas, titik desimal, tanggal, dan pengenal seperti B-204.
  3. Urutan: baca paragraf lengkap melintasi jeda baris; periksa kolom dan teks di dekatnya secara terpisah.
  4. Cakupan: pastikan halaman dan bagian yang Anda butuhkan tidak terlewatkan.
  5. Perilaku file: buka kembali pengganti yang disimpan dan ulangi uji salin. Jika Anda bergantung pada bookmark, tautan, atau struktur aksesibilitas, periksa hal tersebut juga.

Melewati bagian yang dipilih memberikan bukti tentang bagian tersebut. Hal itu tidak mengesahkan seluruh file. Pertahankan gambar halaman asli sebagai referensi, terutama saat memperbaiki kutipan atau bahasa yang tidak dikenal.

Terjemahkan hanya setelah Anda dapat mempercayai sumbernya

Jika tujuan Anda adalah mengutip paragraf atau membuat catatan, ekstrak yang diverifikasi mungkin sudah cukup. Anda tidak memerlukan layanan terjemahan untuk menyelesaikan tugas tersebut.

Jika Anda perlu membaca seluruh dokumen dalam bahasa lain, gunakan file yang telah diverifikasi sebagai titik awal untuk terjemahan PDF. Mode OCR BookTranslator menyusun ulang PDF terjemahan dari konten yang dikenali; hal ini bukan janji untuk memperbaiki lapisan teks yang ada atau mereproduksi tata letak halaman asli secara persis.

Simpan halaman referensi selama langkah terjemahan. Kuantitas dan pengenal yang sama yang diperiksa di sini termasuk dalam tahap QA terjemahan PDF akhir. Terjemahan yang fasih tidak dapat, dengan sendirinya, memberi tahu Anda bahwa sumbernya seharusnya berbunyi 18 alih-alih 13.

Artikel Terkait