BookTranslator
BookTranslator

Sao chép và dán PDF bị sai chữ? Hãy chẩn đoán lớp văn bản trước tiên

Một tệp PDF có thể hiển thị chính xác nhưng lại sao chép sai từ hoặc số. Sử dụng bốn tệp mẫu để xác định các vấn đề về lớp văn bản và chọn cách sửa chữa mà bạn có thể xác minh.

BookTranslator

BookTranslator Team

14 min read

Nếu tệp PDF trông có vẻ chính xác nhưng lại dán ra văn bản sai, hãy ngừng sử dụng phiên bản đã dán làm nguồn của bạn. Đầu tiên, hãy so sánh một đoạn ngắn với trang hiển thị: một tên, một câu và một số. Bước tiếp theo phụ thuộc vào việc tệp không có văn bản trích xuất được, bản đồ ký tự không chính xác, lớp OCR ẩn không chính xác hay vấn đề về thứ tự đọc. Chạy OCR trên toàn bộ tài liệu không phải là bước đầu tiên phù hợp cho cả bốn trường hợp.

Lỗi nguy hiểm nhất không phải là chữ cái vô nghĩa. Đó là văn bản có vẻ hợp lý: một trang hiển thị 18 vở ghi chép trong khi văn bản được trích xuất cho ra 13 vở ghi chép. Chúng tôi đã tạo ra bốn tệp PDF có thể tải xuống để giúp bạn dễ dàng nhận biết sự khác biệt đó mà không cần sử dụng tài liệu riêng tư của bất kỳ ai.

Bắt đầu bằng việc kiểm tra sao chép-và-so sánh ngắn gọn

Giữ nguyên tệp gốc và mở một bản sao làm việc. Dán một đoạn lựa chọn ngắn vào trình soạn thảo văn bản thuần túy, sau đó so sánh từng ký tự với trang hiển thị. Lặp lại trên một trang khác và, nếu có thể, trong trình đọc PDF thứ hai. Đây là bước kiểm tra chẩn đoán, không phải là bằng chứng cho thấy phần còn lại của tài liệu là chính xác.

Hiện tượng xảy raNội dung cần điều traHành động hữu ích đầu tiên
Không thể chọn văn bản hoặc nội dung dán bị trốngTrang có thể chỉ chứa hình ảnhKiểm tra xem trình đọc đang chọn hình ảnh trang hay văn bản
Các chữ cái thay đổi một cách có hệ thống mặc dù chúng trông bình thường trên trangMã hóa ký tự hoặc sơ đồ ánh xạ trích xuấtSo sánh kết quả từ trình đọc khác; tìm tệp nguồn gốc hoặc bản xuất tốt hơn
Hầu hết các từ đều đọc được nhưng tên hoặc số bị saiLớp văn bản không chính xác, bao gồm cả OCR cũSo sánh đoạn trích xuất với bản quét hiển thị
Các chữ cái đúng nhưng cột, chú thích hoặc chú thích cuối trang xuất hiện sai thứ tựTrích xuất bố cục và thứ tự đọcKiểm tra riêng một cột hoặc đoạn văn
Tính năng sao chép bị vô hiệu hóaQuyền của tài liệu hoặc hành vi của trình đọcKiểm tra quyền của tệp và yêu cầu nguồn cung cấp bản sao sử dụng được

Đây là các manh mối, không phải cách để xác định nội dung bên trong của mọi PDF chỉ từ một triệu chứng. Tài liệu hướng dẫn tái sử dụng nội dung của Adobe phân biệt nội dung chỉ có hình ảnh với các hạn chế sao chép. Không nên tự động coi cả hai là lớp văn bản bị hỏng. Hướng dẫn trích xuất pypdf mô tả riêng biệt về hình ảnh, việc trích xuất văn bản và các khó khăn với bảng biểu cũng như khoảng trắng.

Đối với một cuốn sách hoặc báo cáo dài, hãy ghi lại số trang PDF nơi xảy ra từng sự cố. Trang bìa sạch sẽ không cho bạn biết liệu phần phụ lục, trang chèn được quét hay chương hai cột có sao chép chính xác hay không.

Bốn tệp PDF: những gì trang hiển thị so với những gì quá trình trích xuất trả về

Trang thử nghiệm của chúng tôi chứa bốn dòng gốc, bao gồm:

Kho lưu trữ chứa 18 sổ ghi chép.

Mục B-204 đã đến vào ngày 6 tháng 5.

Chúng tôi đã tạo một tệp PDF kỹ thuật số thông thường và cố ý xây dựng ba phương án thay thế. Sau đó, chúng tôi trích xuất văn bản của chúng bằng Poppler và pypdf. Cả hai công cụ trích xuất đều trả về cùng một văn bản cho mỗi tệp trong bài kiểm tra này.

Tải xuống tệp PDFCách chúng tôi xây dựngKết quả trích xuất thực tế
Văn bản kỹ thuật số chính xácVăn bản hiển thị bình thường với phông chữ được nhúng18 notebooks; B-204; 6 May
Ánh xạ Unicode saiĐã thay đổi ánh xạ trích xuất mà không thay đổi các ký tự hiển thị13 notebooks; một số ký tự chữ thường a đã trở thành x
Văn bản ẩn saiĐặt văn bản ẩn sai lệch một cách có chủ đích lên trên hình ảnh trang13 notebooks; B-2O4; 8 May
Trang chỉ có hình ảnhSử dụng cùng một hình ảnh trang không có lớp văn bảnKết quả văn bản trống

Một trang kỹ thuật số trông bình thường có thể sao chép không chính xác

Hai tệp PDF đầu tiên được kết xuất thành các điểm ảnh giống hệt nhau trong phép so sánh của chúng tôi, nhưng văn bản được trích xuất của chúng lại khác nhau. Trong tệp thứ hai, chúng tôi đã thay đổi có chủ đích một ToUnicode ánh xạ: thông tin được sử dụng để ánh xạ các mã ký tự được lưu trữ sang văn bản Unicode. Chữ số hiển thị vẫn là 8, trong khi việc trích xuất trả về kết quả là 3. Tài liệu pypdf CMap minh họa cơ chế ánh xạ này.

Điều này minh họa một cơ chế lỗi, không phải là tuyên bố rằng mọi PDF bị lỗi đều có cùng một khiếm khuyết. Một mục ToUnicode bị thiếu đơn thuần không phải là chẩn đoán của chúng tôi và việc chỉnh sửa ánh xạ thủ công không phải là giải pháp sửa chữa tổng thể hướng đến người đọc.

Một bản quét có thể tìm kiếm có thể chứa các từ sai

Tệp PDF thứ ba và thứ tư cũng được kết xuất giống hệt nhau. Một tệp chứa văn bản ẩn sai; tệp kia không chứa gì cả. Trong tệp thứ ba, quá trình trích xuất đã âm thầm thay đổi cả số lượng và ngày tháng. Đoạn mã B-2O4 chứa chữ cái O, không phải chữ số 0 được hiển thị trong hình ảnh.

Chúng tôi tự chèn các lỗi đó để đại diện cho loại sai lệch mà một lớp văn bản ẩn có thể chứa. Một công cụ OCR không tạo ra chúng. Tệp thứ tư cho thấy tình trạng ngược lại: một hình ảnh trang có thể đọc được nhưng không có gì để các công cụ trích xuất văn bản này trả về. Điều đó phù hợp với giới hạn được tài liệu hóa của pypdf: nó trích xuất văn bản PDF hiện có; nó không nhận dạng các từ bên trong hình ảnh.

Thử nghiệm này thiết lập điều gì—và điều gì thì không

Vào ngày 10 tháng 9 năm 2026, chúng tôi đã kiểm tra bốn tệp một trang bằng Poppler 26.08.0 và pypdf 6.10.0. Các so sánh trực quan đã sử dụng Poppler ở mức 144 dpi. Sự tương đồng về pixel được duy trì trong hai cặp, chứ không phải trên cả bốn tệp: cặp dựa trên hình ảnh đã trải qua một bước kết xuất bổ sung.

Đây là một bản trình diễn có kiểm soát, không phải là một bài kiểm tra chuẩn về độ chính xác của OCR. Nó không kiểm tra nhận dạng đa ngôn ngữ, bố cục phức tạp, sửa lỗi bằng Acrobat, sửa lỗi bằng OCRmyPDF hoặc các tệp tải lên BookTranslator. Đây là những ví dụ được xây dựng với các lỗi đã biết, không phải là một đánh giá mù.

Các văn bản thô và kết quả pixel, hướng dẫn tái lập, và trình tạo có sẵn cùng với các tệp. Chúng sử dụng phông chữ Noto Sans không sửa đổi với giấy phép phông chữ mở đi kèm.

Chọn bước tiếp theo ít gây xáo trộn nhất

Các lộ trình sửa lỗi sau đây đến từ tài liệu chính thức và chẩn đoán thực tế. Chúng không phải là kết quả sửa lỗi từ thử nghiệm bốn tệp của chúng tôi. Hãy thực hiện trên một bản sao và xác minh kết quả đầu ra trước khi thay thế bất kỳ thứ gì bạn đang dựa vào.

Nếu bạn có tài liệu gốc, hãy thử xuất bản mới trước

Một tệp PDF mới từ tệp xử lý văn bản, xuất bản hoặc sắp chữ gốc là một lựa chọn đầu tiên hữu ích. Hãy so sánh chính xác đoạn văn bị lỗi. Đừng giả định rằng một tên tệp mới hoặc việc xuất bản thành công có nghĩa là văn bản của nó hiện đã chính xác.

Đối với tài liệu lấy từ kho lưu trữ hoặc nhà xuất bản, hãy kiểm tra xem có phiên bản thay thế nào chứa văn bản hay không. Giữ cho các tham chiếu về phiên bản và trang được đồng nhất: một tệp sạch hơn của một phiên bản khác có thể không giữ nguyên đoạn văn bạn cần.

Nếu bản quét có một vài lỗi nhận dạng, hãy xem lại những từ đó

Acrobat hướng dẫn một quy trình làm việc tại Quét & OCR → Sửa văn bản đã nhận dạng. Nó cho phép bạn xem lại các từ nghi vấn được gắn thẻ so với hình ảnh đã quét và sửa văn bản đã nhận dạng. Hãy làm theo hướng dẫn sửa lỗi hiện tại của Adobe cho giao diện trong phiên bản của bạn.

Đừng sử dụng danh sách nghi vấn trống như một bài kiểm tra tính đầy đủ. Hãy so sánh độc lập các tên, ngày tháng, mã định danh và số lượng mà bạn sẽ trích dẫn hoặc dịch. Ví dụ sai một cách cố ý của chúng tôi 13 notebooks ví dụ cho thấy tại sao đầu ra có thể đọc được là chưa đủ.

Nếu văn bản ẩn bị sai lệch nghiêm trọng, hãy phân biệt giữa việc làm lại (redo) và ép buộc (force)

Đối với độc giả sử dụng công cụ dòng lệnh, OCRmyPDF mô tả các đường dẫn khác nhau cho các trang đã chứa sẵn văn bản:

  • --redo-ocr loại bỏ văn bản OCR không in được hiện có và nhận diện lại trong khi loại trừ văn bản có thể in ra khỏi quá trình OCR.
  • --skip-text bỏ qua các trang chứa văn bản. Đó không phải là giải pháp sửa chữa cho một lớp văn bản bị sai từ trước.
  • --force-ocr chuyển đổi nội dung trang thành dạng raster và chạy OCR trên các hình ảnh thu được.

Những hành vi này được mô tả trong tài liệu lỗi văn bản hiện có của OCRmyPDF. Trong phiên bản 17, các tùy chọn tương đương cũng có sẵn thông qua --mode; các cờ cũ hơn vẫn giữ nguyên vai trò là tên bí danh.

Tuy nhiên, phương pháp này có những chi phí và ngoại lệ. Chức năng làm lại không thể nhận diện mọi bố cục OCR lịch sử; một số tệp đặt hình ảnh mờ đục lên trên văn bản vốn có thể in được về mặt kỹ thuật. Chức năng ép buộc biến văn bản có thể in và nội dung vector thành điểm ảnh (pixel) đồng thời làm phẳng nội dung tương tác. Cả hai tính năng này cũng loại bỏ cấu trúc phân cấp sẵn có thay vì tái tạo lại nó. Hãy xem lại tài liệu nâng cao của OCRmyPDF trước khi lựa chọn bất kỳ phương án nào.

Do đó, một bản trích xuất được sửa chữa không phải là một quy trình kiểm tra khả năng tiếp cận (accessibility pass). Nếu tài liệu cần các tiêu đề, thứ tự đọc hoặc hình ảnh có thể truy cập, hãy sử dụng phần riêng biệt các bài kiểm tra khả năng tiếp cận PDF đã dịch.

Nếu các trang hoặc ngôn ngữ khác nhau, đừng giả định rằng một cài đặt duy nhất phù hợp với tất cả

Hãy liệt kê những trang nào đã chứa văn bản kỹ thuật số đáng tin cậy và trang nào cần nhận diện. Kiểm tra ngôn ngữ trên các trang bị ảnh hưởng trước khi định cấu hình OCR. Bài viết hướng dẫn OCR PDF đa ngôn ngữ của chúng tôi đề cập đến việc lựa chọn ngôn ngữ; đây là một quyết định khác biệt so với việc xác định xem lớp văn bản cũ có bị sai hay không.

Nếu hoàn toàn không có lớp văn bản nào, hãy chuyển sang quy trình làm việc với PDF quét. Việc liên tục thử một trình trích xuất văn bản thuần túy khác sẽ không giúp pypdf nhận diện được các từ trong hình ảnh.

Xác minh văn bản thay thế trước khi sử dụng

Sử dụng tờ kiểm tra lớp văn bản có thể tải xuống để giữ cho tài liệu tham khảo hiển thị, bản trích xuất trước đó và bản trích xuất thay thế ở cạnh nhau. Bắt đầu với lỗi đã biết, sau đó kiểm tra một đoạn văn khác và bất kỳ bố cục trang nào khác biệt rõ rệt.

  1. Từ ngữ: so sánh tên và thuật ngữ không quen thuộc từng chữ cái.
  2. Số liệu: kiểm tra số lượng, dấu thập phân, ngày tháng và các định identifier như B-204.
  3. Thứ tự: đọc toàn bộ đoạn văn qua các dấu ngắt dòng; kiểm tra riêng các cột và chú thích gần đó.
  4. Độ phủ: xác nhận rằng các trang và đoạn văn bạn cần không bị bỏ sót.
  5. Hành vi của tệp: mở lại bản thay thế đã lưu và lặp lại bài kiểm tra sao chép. Nếu bạn phụ thuộc vào dấu trang, liên kết hoặc cấu trúc trợ năng, hãy kiểm tra cả những phần đó.

Việc vượt qua các đoạn văn đã chọn cung cấp bằng chứng về các đoạn văn đó. Nó không chứng nhận toàn bộ tệp. Giữ nguyên hình ảnh trang gốc làm tài liệu tham khảo, đặc biệt là khi sửa một câu trích dẫn hoặc một ngôn ngữ không quen thuộc.

Chỉ dịch sau khi bạn có thể tin tưởng nguồn

Nếu mục tiêu của bạn là trích dẫn một đoạn văn hoặc ghi chú, một bản trích xuất đã xác minh có thể là điểm kết thúc. Bạn không cần dịch vụ dịch thuật để giải quyết tác vụ đó.

Nếu bạn cần đọc toàn bộ tài liệu bằng ngôn ngữ khác, hãy sử dụng tệp đã xác minh làm điểm khởi đầu cho dịch PDF. Chế độ OCR của BookTranslator xây dựng lại một bản dịch PDF từ nội dung được nhận dạng; đó không phải là lời hứa sửa chữa bất kỳ lớp văn bản hiện có nào hoặc tái tạo chính xác bố cục trang ban đầu.

Giữ các trang tham khảo trong suốt bước dịch thuật. Các số lượng và định danh giống nhau được kiểm tra ở đây thuộc về bước kiểm tra chất lượng dịch PDF cuối cùng. Một bản dịch trôi chảy không thể tự nó cho bạn biết rằng nguồn của nó nên là 18 thay vì 13.

Bài viết liên quan