Salinan Teks PDF Memberikan Teks yang Salah? Diagnosis Lapisan Teks Terlebih Dahulu
Fail PDF mungkin kelihatan betul tetapi menyalin perkataan atau nombor yang salah. Gunakan empat fail sampel untuk mengenal pasti masalah lapisan teks dan pilih pembaikan yang boleh anda sahkan.

Jika fail PDF kelihatan betul tetapi menampal teks yang salah, berhenti daripada menggunakan versi yang ditampal itu sebagai sumber anda. Mulakan dengan membandingkan petikan pendek dengan halaman yang kelihatan: satu nama, satu ayat, dan satu nombor. Langkah seterusnya bergantung pada sama ada fail tersebut tidak mempunyai teks yang boleh diekstrak, pemetaan aksara yang salah, lapisan OCR tersembunyi yang tidak tepat, atau masalah susunan bacaan. Menjalankan OCR pada keseluruhan dokumen bukanlah langkah pertama yang betul untuk keempat-empat keadaan ini.
Ralat yang paling berbahaya bukanlah teks yang tidak bermakna. Ia adalah teks yang munasabah: halaman yang memaparkan 18 buah buku nota , manakala teks yang diekstrak memaparkan 13 buah buku nota. Kami telah mencipta चार fail PDF yang boleh dimuat turun untuk menjadikan perbezaan itu kelihatan ketara, tanpa menggunakan dokumen peribadi sesiapa.
Mulakan dengan semakan salin-dan-banding yang kecil
Kekalkan fail asal tanpa sebarang perubahan dan buka salinan kerja. Tampal satu pilihan pendek ke dalam editor teks biasa, kemudian bandingkan aksara demi aksara dengan halaman tersebut. Ulangi pada halaman yang berbeza dan, jika ada, dalam pembaca PDF yang kedua. Ini adalah semakan diagnostik, bukan bukti bahawa seluruh dokumen itu betul.
| Apa yang berlaku | Apa yang perlu disiasat | Tindakan berguna yang pertama |
|---|---|---|
| Tiada yang boleh dipilih, atau proses tampal kosong | Halaman mungkin hanya mengandungi imej | Semak sama ada pembaca sedang memilih imej halaman berbanding teks |
| Huruf berubah secara konsisten, walaupun ia kelihatan biasa pada halaman | Pengekodan aksara atau pemetaan pengekstrakan | Bandingkan output pembaca lain; cari fail sumber asal atau eksport yang lebih baik |
| Kebanyakan perkataan boleh dibaca, tetapi nama atau nombor adalah salah | Lapisan teks yang tidak tepat, termasuk OCR lama | Bandingkan petikan yang diekstrak dengan imbasan yang kelihatan |
| Huruf adalah betul, tetapi lajur, kapsyen, atau nota kaki muncul dalam susunan yang salah | Pengekstrakan susun atur dan susunan bacaan | Uji satu kolumn atau perenggan secara berasingan |
| Salinan dinyahaktifkan | Kebenaran dokumen atau tingkah laku pembaca | Semak kebenaran fail dan minta salinan yang boleh digunakan daripada sumber |
Ini adalah petunjuk, bukan cara untuk mengenali bahagian dalam setiap PDF daripada satu simptom. Panduan penghasilan semula kandungan oleh Adobe membezakan kandungan imej sahaja daripada sekatan salinan. Tiada satu pun daripadanya harus dianggap secara automatik sebagai lapisan teks yang rosak. Panduan pengekstrakan pypdf menerangkan secara berasingan tentang imej, pengekstrakan teks, serta kesukaran dengan jadual dan jarak.
Untuk buku atau laporan yang panjang, catatkan nombor halaman PDF tempat berlakunya setiap masalah. Halaman tajuk yang bersih tidak memberitahu anda sama ada lampiran, sisipan imbasan, atau bab dua kolumn akan disalin dengan betul.
Empat PDF: apa yang dipaparkan oleh halaman berbanding apa yang dikembalikan oleh pengekstrakan
Halaman ujian kami mengandungi empat baris asal, termasuk:
Arkib itu mengandungi 18 buku nota.
Item B-204 tiba pada 6 Mei.
Kami menghasilkan satu PDF digital biasa dan sengaja membina tiga alternatif. Kemudian kami mengekstrak teks mereka menggunakan Poppler dan pypdf. Kedua-dua pengekstrak mengembalikan teks yang sama untuk setiap fail dalam ujian ini.
| Muat turun PDF | Bagaimana kami membinanya | Keputusan pengekstrakan sebenar |
|---|---|---|
| Teks digital yang betul | Teks biasa yang kelihatan dengan fon terbenam | 18 notebooks; B-204; 6 May |
| Pemetaan Unicode yang salah | Mengubah pemetaan pengekstrakan, tanpa menukar glyph yang kelihatan | 13 notebooks; beberapa huruf kecil a telah menjadi x |
| Teks tersembunyi yang salah | Sengaja meletakkan teks tak kelihatan yang salah di atas imej halaman | 13 notebooks; B-2O4; 8 May |
| Halaman imej sahaja | Menggunakan imej halaman yang sama tanpa lapisan teks | Output teks kosong |
Halaman digital yang kelihatan normal boleh disalin dengan tidak betul
Dua fail PDF pertama dirender kepada piksel yang seiras dalam perbandingan kami, namun teks yang diekstrak berbeza. Dalam fail kedua, kami sengaja mengubah suatu ToUnicode pemetaan: maklumat yang digunakan untuk memetakan kod aksara tersimpan kepada teks Unicode. Nombor yang kelihatan kekal 8, manakala pengekstrakan mengembalikan 3. Dokumentasi CMap pypdf menggambarkan mekanisme pemetaan ini.
Ini menunjukkan satu mekanisme kegagalan, bukan dakwaan bahawa setiap PDF yang bercelaru mempunyai kecacatan yang sama. Entri ToUnicode yang hilang sahaja bukanlah diagnosis kami, dan mengedit pemetaan secara manual bukanlah pembaikan umum untuk pembaca.
Imbasan boleh cari boleh mengandungi perkataan yang salah
PDF ketiga dan keempat juga dirender secara seiras antara satu sama lain. Satu mengandungi teks tersembunyi yang salah; satu lagi tidak mengandungi apa-apa. Dalam fail ketiga, pengekstrakan mengubah kuantiti dan tarikh secara senyap. Kod B-2O4 mengandungi huruf O, bukan nombor 0 yang ditunjukkan dalam imej.
Kami memasukkan ralat tersebut sendiri untuk mewakili jenis ketidakpadanan yang boleh terkandung dalam lapisan teks tersembunyi. Enjin OCR tidak menjikannya. Fail keempat menunjukkan keadaan sebaliknya: imej halaman yang boleh dibaca tanpa apa-apa untuk dikembalikan oleh pengekstrak teks ini. Ini konsisten dengan terhadan didokumenkan pypdf: ia mengekstrak teks PDF sedia ada; ia tidak mengecam perkataan di dalam imej.
Perkara yang ditetapkan oleh ujian ini—dan perkara yang tidak
Pada 10 September 2026, kami telah menyemak empat fail satu halaman menggunakan Poppler 26.08.0 dan pypdf 6.10.0. Perbandingan visual menggunakan Poppler pada 144 dpi. Kesamaan piksel dikekalkan dalam dua pasangan tersebut, bukan merentasi kesemua empat fail: pasangan berasaskan imej melalui langkah perenderaan tambahan.
Ini adalah demonstrasi terkawal, bukannya penanda aras ketepatan OCR. Ia tidak menguji pengecaman berbilang bahasa, susun atur yang kompleks, pembaikan Acrobat, pembaikan OCRmyPDF, atau muat naik BookTranslator. Ini adalah contoh yang dibina dengan ralat yang diketahui, bukannya penilaian buta.
Keputusan teks mentah dan piksel, arahan pengeluaran semula, dan penjana tersedia bersama fail tersebut. Ia menggunakan fon Noto Sans yang tidak diubah suai dengan lesen fon terbuka yang disertakan.
Pilih langkah seterusnya yang paling kurang mengganggu
Laluan pembaikan berikut berasal daripada dokumentasi rasmi dan diagnosis praktikal. Ia bukannya keputusan pembaikan daripada eksperimen empat fail kami. Lakukan kerja pada salinan dan sahkan output sebelum menggantikan apa-apa yang anda harapkan.
Jika anda mempunyai dokumen sumber, cuba eksport baharu terlebih dahulu
PDF baharu daripada fail pemprosesan kata, penerbitan, atau reka letak asal adalah calon pertama yang berguna. Bandingkan petikan yang gagal itu dengan tepat. Jangan anggap nama fail baharu atau eksport yang berjaya bermakna teksnya kini sudah betul.
Untuk bahan yang diperoleh daripada arkib atau penerbit, semak sama ada wujud versi alternatif yang mengandungi teks. Pastikan rujukan edisi dan halaman selari: fail yang lebih bersih daripada edisi yang berbeza mungkin tidak mengekalkan petikan yang anda perlukan.
Jika imbasan mempunyai beberapa ralat pengecaman, semak perkataan tersebut
Acrobat mendokumenkan aliran kerja di bawah Imbas & OCR → Betulkan teks yang dicam. Ia membolehkan anda menyemak perkataan yang ditandakan sebagai mencurigakan berbanding imej yang diimbas dan membetulkan teks yang dicam. Ikuti arahan pembetulan semasa Adobe untuk antara muka dalam versi anda.
Jangan gunakan senarai suspek yang kosong sebagai ujian kesempurnaan. Bandingkan secara bebas nama, tarikh, pengecam, dan kuantiti yang akan anda petik atau terjemah. Contoh kami yang sengaja disalah buat 13 notebooks contoh menunjukkan mengapa output yang boleh dibaca sahaja tidak mencukupi.
Jika teks tersembunyi secara meluas salah,bezakan antara redo dan force
Bagi pembaca yang menggunakan alat baris arahan, OCRmyPDF mendokumenkan laluan berbeza untuk halaman yang sudah mengandungi teks:
--redo-ocrmengalih keluar teks OCR bukan cetakan sedia ada dan mengecam semula sambil mengecualikan teks boleh cetak daripada OCR.--skip-textmelangkau halaman yang mengandungi teks. Itu bukanlah pembaikan bagi lapisan teks salah yang sedia ada.--force-ocrmelakukan raster pada kandungan halaman dan menjalankan OCR pada imej yang terhasil.
Tingkah laku ini diterangkan dalam dokumentasi ralat teks sedia ada OCRmyPDF. Dalam versi 17, pilihan setara juga tersedia melalui --mode; bendera yang lebih lama kekal sebagai alias.
Terdapat kos dan pengecualian. Redo tidak dapat mengenal pasti setiap susunan OCR masa lalu; sesetengah fail meletakkan imej legap di atas teks yang secara teknikalnya boleh dicetak. Force menukar teks boleh cetak dan kandungan vektor kepada piksel serta meratakan kandungan interaktif. Redo dan force juga membuang pokok struktur sedia ada berbanding membinakannya semula. Semak dokumentasi lanjutan OCRmyPDF sebelum memilih salah satu daripadanya.
Oleh itu, ekstrak yang dibaiki bukanlah pas kebolehcapaian. Jika dokumen memerlukan tajuk, susunan bacaan, atau rajah boleh diakses, gunakan pemeriksaan kebolehcapaian PDF yang diterjemahkan.
berasingan
Senaraikan halaman yang sudah mengandungi teks digital boleh dipercayai dan halaman yang memerlukan pengecaman. Semak bahasa pada halaman yang terjejas sebelum mengkonfigurasi OCR. Panduan OCR PDF pelbagai bahasa kami merangkumi pemilihan bahasa; ia adalah keputusan yang berbeza daripada menentukan sama ada lapisan teks lama adalah salah.
Jika tiada lapisan teks langsung, beralih kepada aliran kerja PDF imbasan. Percubaan berulang kali menggunakan pengekstrak teks biasa yang lain tidak akan menyebabkan pypdf mengenali perkataan dalam imej.
Sahkan teks pengganti sebelum menggunakannya
Gunakan helaian semakan lapisan teks yang boleh dimuat turun untuk memastikan rujukan yang kelihatan, ekstraksi sebelumnya, and ekstraksi penggantian bersebelahan. Mulakan dengan kegagalan yang diketahui, kemudian uji petikan lain dan sebarang susun atur halaman yang berbeza.
- Perkataan: bandingkan nama dan terma yang tidak dikenali huruf demi huruf.
- Nombor: semak kuantiti, titik perpuluhan, tarikh, dan pengecam seperti
B-204. - Susunan: baca perenggan lengkap merentasi pemecahan baris; semak lajur dan kapsyen berdekatan secara berasingan.
- Liputan: sahkan bahawa halaman dan petikan yang anda perlukan tidak tertinggal.
- Kelakuan fail: buka semula penggantian yang disimpan dan ulangi ujian salin. Jika anda bergantung pada penanda halaman, pautan, atau struktur boleh akses, semak perkara itu juga.
Menyerahkan petikan terpilih memberikan bukti tentang petikan tersebut. Ia tidak memperakui keseluruhan fail. Kekalkan imej halaman asal sebagai rujukan, terutamanya apabila membetulkan petikan atau bahasa yang tidak dikenali.
Terjemah hanya selepas anda boleh mempercayai sumber
Jika matlamat anda adalah untuk memetik perenggan atau mengambil nota, ekstrak yang disahkan mungkin sudah memadai. Anda tidak memerlukan perkhidmatan terjemahan untuk menyelesaikan tugasan itu.
Jika anda perlu membaca keseluruhan dokumen dalam bahasa lain, gunakan fail yang disahkan sebagai titik permulaan anda untuk terjemahan PDF. Mod OCR BookTranslator membina semula PDF yang diterjemahkan daripada kandungan yang diiktiraf; ia bukan janji untuk membaiki mana-mana lapisan teks sedia ada atau menghasilkan semula susun atur halaman asal dengan tepat.
Kekalkan halaman rujukan melalui langkah terjemahan. Kuantiti dan pengecam yang sama yang disemak di sini tergolong dalam lulusan QA terjemahan PDF akhir. Terjemahan yang fasih tidak boleh, dengan sendirinya, memberitahu anda bahawa sumbernya sepatutnya menyatakan 18 berbanding 13.
Catatan Berkaitan





