BookTranslator
BookTranslator

Terjemahkan PDF Imbasan: Masalah OCR dan Penyelesaian Praktikal

Ketahuinya cara melakukan OCR dan menterjemahkan PDF imbasan, mendiagnosis kegagalan pengecaman biasa, dan memelihara reka letak dengan aliran kerja yang sedar dokumen.

BookTranslator

BookTranslator Team

9 min read

Jawapan Pantas: PDF Imbasan Memerlukan OCR Sebelum Terjemahan

Untuk menterjemahkan PDF imbasan, jalankan OCR terlebih dahulu untuk menukar imej halaman kepada teks yang boleh dipilih. Kemudian, terjemahkan PDF yang diproses OCR dengan penterjemah dokumen seperti PDF Translator. Jika anda melangkau OCR, kebanyakan alat terjemahan akan mengembalikan fail asal tanpa perubahan, terlepas halaman, atau hanya menterjemahkan bahagian yang sudah mengandungi lapisan teks.

Gunakan aliran kerja ini:

  1. Buka PDF dan cuba pilih satu ayat.
  2. Jika anda tidak dapat memilih teks, jalankan OCR.
  3. Semak teks OCR sebelum menterjemah.
  4. Muat naik PDF yang diproses OCR ke PDF Translator.
  5. Semak output yang diterjemahkan berbanding imbasan asal.

Jika PDF anda sudah mempunyai teks yang boleh dipilih dan isu tersebut adalah pemeliharaan reka letak, gunakan panduan untuk menterjemah PDF tanpa kehilangan pemformatan.

Mengapa PDF Imbasan Gagal dalam Alat Terjemahan

PDF imbasan selalunya hanyalah sekumpulan imej halaman di dalam bekas PDF. Halaman tersebut mungkin memaparkan perkataan kepada manusia, tetapi fail mungkin tidak mengandungi teks sebenar untuk diekstrak oleh perisian.

Itu mewujudkan kegagalan mudah:

Jenis failApa yang dilihat oleh penterjemahApa yang berlaku
PDF berasaskan teksTeks berserta data reka letakTerjemahan boleh dimulakan dengan segera.
PDF imbasan sahajaGambar halamanOCR diperlukan terlebih dahulu.
PDF teks atas imejImej imbasan berserta lapisan teks OCR tersembunyiTerjemahan boleh berfungsi, tetapi ralat OCR menjejaskan kualiti.

Ujian yang paling berguna bukanlah teknikal:

  1. Buka PDF.
  2. Cuba serlahkan perkataan individu.
  3. Salin satu ayat.
  4. Tampalkannya ke dalam penyunting teks.

Jika ayat tersebut tampal dengan betul, PDF mempunyai lapisan teks. Jika tiada apa-apa yang ditampal, atau keseluruhan halaman bertindak seperti satu imej, PDF memerlukan OCR.

OCR Bukan Pilihan

OCR bermaksud pengecaman aksara optik. Ia membaca teks daripada imej dan mencipta teks yang boleh dibaca mesin. Untuk terjemahan PDF, OCR biasanya mencipta lapisan teks halimunan di atas halaman yang diimbas.

Lapisan teks itu menjadi sumber untuk terjemahan. Jika OCR melakukan kesilapan, terjemahan akan mewarisi kesilapan tersebut.

Kesilapan OCR biasa:

Kesilapan OCRRisiko terjemahan
rn dibaca sebagai mPerkataan berubah makna.
1 dibaca sebagai lNombor, rujukan, atau kod menjadi salah.
O dibaca sebagai 0ID, formula, dan nama boleh rosak.
Tanda diacritic digugurkanNama dan terma menjadi tidak tepat.
Lajur digabungkanAyat diterjemahkan dalam susunan yang salah.
Sel jadual dibaca baris demi baris dengan salahLabel data tidak lagi sepadan dengan nilai.
Nota kaki dianggap sebagai teks badanPetikan dan nota beralih ke konteks yang salah.

Inilah sebabnya langkah semakan OCR penting. Jangan terjemahkan dokumen imbasan sehingga anda telah membuat semakan spot pada teks yang diekstrak.

Aliran Kerja Utama OCR

Langkah 1: Kenal Pasti Jenis PDF

Cuba pilih teks. Jika pemilihan berfungsi, anda mungkin tidak memerlukan OCR. Jika pemilihan gagal, anggap fail sebagai imbasan sahaja.

Juga periksa halaman secara visual:

  • Halaman condong mencadangkan imbasan.
  • Tekstur kertas kelabu mencadangkan imbasan.
  • Bayang-bayang berhampiran tulang belakang mencadangkan buku yang difoto.
  • Kontras tidak sekata mencadangkan fotokopi.
  • Carian tidak menemui perkataan kelihatan mencadangkan tiada lapisan teks.

Langkah 2: Tingkatkan Imbasan Jika Mampu

Kualiti OCR bermula dengan kualiti imej. Jika anda boleh mengimbas semula, lakukan sebelum meluangkan masa membaiki ralat OCR.

Gunakan senarai semak kualiti imej ini:

  • Imbas pada resolusi yang cukup tinggi untuk teks kecil.
  • Pastikan halaman rata dan lurus.
  • Elakkan bayang-bayang berhampiran tulang belakang.
  • Potong tepi jadual, jari, atau kekacauan latar belakang.
  • Gunakan kontras yang kuat antara teks dan halaman.
  • Pastikan keseluruhan baris kelihatan.
  • Gunakan orientasi halaman yang betul.
  • Jangan mampatkan imej dengan begitu berat sehingga huruf kabur.

Untuk buku lama dan fotokopi, kemenangan terbesar biasanya datang daripada pembetulan kecondongan, pembetulan kontras, dan pengimbasan semula halaman yang kabur.

Langkah 3: Jalankan OCR

Pilih alat OCR berdasarkan dokumen, bukan jenama.

Pilihan OCRPaling baik untukWaspada terhadap
Adobe Acrobat OCRImbasan perniagaan am dan pembersihan PDFSemak akses pelan semasa sebelum bergantung padanya.
ABBYY FineReaderImbasan kompleks, jadual, lajur, dan susun atur sukarMasih memerlukan semakan manual.
Tesseract atau OCRmyPDFAliran kerja OCR tempatan, teknikal, boleh diulangMemerlukan keselesaan dengan alat baris perintah.
Alat OCR dalam talianFail sekali-sekala berisiko rendahPrivasi, had fail, dan kualiti berbeza-beza.
Aplikasi pengimbasan telefonMenangkap imbasan baharu dengan cepatHerotan perspektif boleh merosakkan OCR.

Untuk kontrak peribadi, rekod perubatan, dokumen kewangan, manuskrip yang belum diterbitkan, atau kerja akademik di bawah semakan, utamakan aliran kerja OCR tempatan atau persekitaran yang dipercayai. Jangan muat naik imbasan sensitif ke tapak OCR percuma secara rawak.

Langkah 4: Semak Teks OCR

Semak sebelum terjemahan, bukan selepas. Salin teks daripada beberapa halaman sukar dan semak sama ada ia boleh dibaca.

Contoh halaman untuk diperiksa:

  • Halaman tajuk.
  • Halaman badan yang padat.
  • Halaman jadual.
  • Halaman dengan nota kaki.
  • Halaman dengan teks kecil.
  • Halaman dengan setem, tulisan tangan, atau nota pinggir.
  • Halaman dalam setiap bahasa jika dokumen itu berbilang bahasa.

Cari:

  • Perenggan yang hilang.
  • Lajur yang digabungkan.
  • Perkataan yang rosak.
  • Aksara yang salah.
  • Tanda diacritic yang hilang.
  • Label jadual dipisahkan daripada nilai.
  • Tajuk dimasukkan ke dalam teks badan.
  • Nombor halaman dicampur ke dalam ayat.

Jika kualiti OCR adalah buruk, betulkan sebelum terjemahan. Penterjemah tidak dapat memulihkan makna dengan boleh dipercayai yang tidak pernah ditangkap oleh OCR.

Langkah 5: Terjemahkan PDF yang Diproses OCR

Sebaik sahaja PDF mempunyai lapisan teks yang bersih, muat naiknya ke PDF Translator. Langkah terjemahan kini boleh berfungsi dengan teks dan bukannya imej halaman.

Selepas terjemahan, bandingkan:

  • Imbasan asal
  • Lapisan teks OCR
  • PDF yang diterjemahkan

Semakan tiga hala ini membantu anda mengenalpasti sama ada ralat datang daripada OCR atau terjemahan. Jika teks OCR salah, jalankan semula OCR. Jika teks OCR betul tetapi terjemahan salah, betulkan terjemahan.

Langkah 6: Semak Kandungan Berisiko Tinggi

Dokumen imbasan selalunya mengandungi kandungan yang memerlukan semakan teliti: kontrak lama, borang kerajaan, kertas akademik, manual, dokumen sejarah, dan halaman buku.

Semak item ini secara manual:

  • Nama
  • Tarikh
  • Nombor
  • Alamat
  • Kod produk
  • Rujukan undang-undang
  • Petikan
  • Label jadual
  • Unit
  • Persamaan
  • Kapsyen
  • Nota kaki

Untuk fail penyelidikan dan akademik, baca juga panduan untuk menterjemah kertas penyelidikan akademik, kerana PDF akademik yang diimbas menambah risiko petikan dan reka letak di atas risiko OCR.

Contoh Kegagalan Sebelah-menyebelah

Gunakan jadual ini semasa menyemak output OCR.

Imbasan asal mungkin menunjukkanOutput OCR burukMengapa ia penting
modernmodemMakna berubah sepenuhnya.
Section 10Section IORujukan undang-undang atau teknikal boleh rosak.
20262O26Tarikh dan ID menjadi tidak boleh dipercayai.
patientpatlentTerma perubatan atau teknikal menjadi salah.
Dua lajur berasinganSatu perenggan tergabungTerjemahan membaca ayat dalam susunan yang salah.
Baris jadual dengan label dan nilaiSatu baris teks bercampurData tidak lagi dipetakan pada label yang betul.
Penanda nota kaki 1Huruf lNota mungkin melekat pada ayat yang salah.

Jika anda melihat ralat ini dalam lapisan OCR, betulkan OCR sebelum menterjemah.

Alat Manakah yang Perlu Anda Gunakan?

Pilih mengikut kesukaran dokumen.

DokumenLaluan yang disyorkan
Imbasan perniagaan bersihOCR dalam Acrobat atau alat OCR lain yang boleh dipercayai, kemudian PDF Translator.
Imbasan buku lamaLuruskan dan tingkatkan kontras, OCR dengan teliti, kemudian terjemahkan.
Imbasan kertas akademikOCR, semak persamaan/petikan/jadual, kemudian terjemahkan dengan semakan reka letak.
Nota tulisan tanganTranskripsi manual mungkin diperlukan sebelum terjemahan.
Dokumen peribadi ringkasOCR dalam talian mungkin boleh diterima jika risiko privasi rendah.
Dokumen sensitifGunakan OCR tempatan atau aliran kerja terkawal yang dipercayai.

Jika anda mahukan perbandingan alat yang lebih luas, lihat panduan penterjemah PDF terbaik.

Masalah PDF Imbasan Biasa

Halaman Resolusi Rendah

Imbasan resolusi rendah mengaburkan huruf bersama-sama. OCR mungkin keliru antara rn dan m, cl dan d, atau tanda baca dan habuk.

Pembaikan: imbas semula jika boleh. Jika tidak, tingkatkan kontras dan cuba OCR semula.

Halaman Condong atau Melengkung

Imbasan buku selalunya melengkung berhampiran tulang belakang. OCR membaca garis melengkung dengan buruk dan mungkin menyusun semula teks.

Pembaikan: ratakan halaman, imbas semula, atau gunakan alat OCR dengan pelurusan kecondongan dan penyahlengkungan.

Susun Atur Berbilang Lajur

OCR boleh menggabungkan lajur kiri dan kanan ke dalam satu aliran ayat.

Pembaikan: periksa susunan bacaan sebelum terjemahan. Kertas akademik memerlukan perhatian khas di sini.

Jadual

Jadual adalah sukar kerana OCR perlu mengesan kedua-dua teks dan struktur. Jadual boleh kelihatan betul secara visual manakala lapisan teks adalah salah.

Pembaikan: salin teks OCR daripada jadual dan sahkan label masih sepadan dengan nilai.

Tulisan Tangan dan Tandatangan

OCR teks bercetak adalah jauh lebih boleh dipercayai daripada pengecaman tulisan tangan. Nota pinggir tulisan tangan, tandatangan, dan borang yang diisi mungkin terlepas atau terpesong.

Pembaikan: transkripkan tulisan tangan penting secara manual sebelum terjemahan.

Bahasa Bercampur

OCR berfungsi paling baik apabila ia mengetahui bahasa sumber. Imbasan dengan bahasa Inggeris, Perancis, dan Cina boleh gagal jika OCR ditetapkan kepada satu bahasa sahaja.

Pembaikan: pilih semua bahasa OCR yang relevan jika alat itu menyokongnya, kemudian buat semakan spot pada setiap bahagian bahasa.

Senarai Semak Privasi dan Keselamatan

Sebelum memuat naik PDF imbasan ke mana-mana sahaja, tanyakan:

  • Adakah dokumen itu mengandungi data peribadi?
  • Adakah ia merangkumi bahan perubatan, undang-undang, kewangan, akademik, atau bahan yang belum diterbitkan?
  • Adakah ia dilindungi oleh perjanjian pelanggan atau dasar sekolah?
  • Adakah perkhidmatan OCR dalam talian dibenarkan untuk dokumen ini?
  • Adakah anda memerlukan aliran kerja tempatan sebaliknya?
  • Bolehkah anda membuang halaman yang tidak memerlukan terjemahan?

PDF imbasan selalunya sensitif kerana ia datang daripada kontrak, ID, borang, draf penyelidikan, dan arkib dalaman. Rawat keputusan muat naik OCR dengan cara yang sama anda akan merawat dokumen asal.

Catatan Berkaitan