BookTranslator
BookTranslator

Dịch PDF Đã Quét: Các Vấn Đề Về OCR và Giải Pháp Thực Tế

Tìm hiểu cách thực hiện OCR và dịch các tệp PDF đã quét, chẩn đoán các lỗi nhận diện phổ biến và giữ nguyên bố cục với quy trình hỗ trợ tài liệu.

BookTranslator

BookTranslator Team

13 min read

Câu Trả Lời Nhanh: PDF Đã Quét Cần OCR Trước Khi Dịch

Để dịch một tệp PDF đã quét, trước tiên hãy chạy OCR để chuyển đổi hình ảnh trang thành văn bản có thể chọn được. Sau đó, dịch tệp PDF đã qua xử lý OCR bằng trình dịch tài liệu như PDF Translator. Nếu bạn bỏ qua bước OCR, nhiều công cụ dịch sẽ trả về tệp gốc mà không thay đổi, bỏ sót các trang hoặc chỉ dịch các phần vốn đã chứa lớp văn bản.

Sử dụng quy trình này:

  1. Mở tệp PDF và thử chọn một câu.
  2. Nếu bạn không thể chọn văn bản, hãy chạy OCR.
  3. Xem xét văn bản OCR trước khi dịch.
  4. Tải tệp PDF đã qua xử lý OCR lên PDF Translator.
  5. Kiểm tra kết quả đã dịch so với bản quét gốc.

Nếu tệp PDF của bạn đã có sẵn văn bản có thể chọn và vấn đề nằm ở việc bảo toàn bố cục, hãy sử dụng hướng dẫn dịch tệp PDF mà không mất định dạng.

Lý Do PDF Đã Quét Thường Thất Bại Trong Các Công Cụ Dịch

Một tệp PDF đã quét thường chỉ là tập hợp các hình ảnh trang nằm bên trong một vùng chứa PDF. Trang tài liệu có thể hiển thị các từ đối với con người, nhưng tệp có thể không chứa văn bản thực tế để phần mềm trích xuất.

Điều đó tạo ra một lỗi đơn giản:

Loại tệpTrình dịch nhìn thấy gìĐiều gì xảy ra
PDF dựa trên văn bảnVăn bản cộng với dữ liệu bố cụcQuá trình dịch có thể bắt đầu ngay lập tức.
PDF chỉ có hình ảnh (đã quét)Hình ảnh của các trangCần phải chạy OCR trước.
PDF có văn bản chồng lên hình ảnhHình ảnh bản quét cộng với lớp văn bản OCR ẩnQuá trình dịch có thể hoạt động, nhưng lỗi OCR ảnh hưởng đến chất lượng.

Bài kiểm tra hữu ích nhất không mang tính kỹ thuật:

  1. Mở tệp PDF.
  2. Thử tô sáng từng từ riêng lẻ.
  3. Sao chép một câu.
  4. Dán câu đó vào trình soạn thảo văn bản.

Nếu câu được dán chính xác, tệp PDF có lớp văn bản. Nếu không có gì được dán hoặc toàn bộ trang hoạt động giống như một hình ảnh duy nhất, tệp PDF cần phải chạy OCR.

OCR Không Phải Là Tùy Chọn

OCR có nghĩa là nhận dạng ký tự quang học (Optical Character Recognition). Công nghệ này đọc văn bản từ hình ảnh và tạo ra văn bản máy có thể đọc được. Đối với việc dịch PDF, OCR thường tạo ra một lớp văn bản vô hình nằm đè lên trang được quét.

Lớp văn bản đó trở thành nguồn cho quá trình dịch. Nếu OCR mắc lỗi, quá trình dịch sẽ kế thừa những lỗi đó.

Các lỗi OCR phổ biến:

Lỗi OCRRủi ro dịch thuật
rn bị đọc thành mCác từ thay đổi ý nghĩa.
1 bị đọc thành lSố, tài liệu tham khảo hoặc mã số trở nên sai lệch.
O bị đọc thành 0ID, công thức và tên có thể bị lỗi.
Dấu phụ bị mấtTên và thuật ngữ trở nên không chính xác.
Các cột bị hợp nhấtCác câu được dịch sai thứ tự.
Các ô trong bảng bị đọc nhầm theo hàngNhãn dữ liệu không còn khớp với các giá trị.
Chú thích chân trang bị coi là văn bản chínhTrích dẫn và ghi chú chuyển sang sai ngữ cảnh.

Đây là lý do tại sao bước kiểm tra OCR rất quan trọng. Không dịch tài liệu đã quét cho đến khi bạn đã kiểm tra ngẫu nhiên phần văn bản được trích xuất.

Quy Trình Ưu Tiên OCR

Bước 1: Xác Định Loại PDF

Thử chọn văn bản. Nếu việc chọn văn bản hoạt động, bạn có thể không cần OCR. Nếu việc chọn văn bản thất bại, hãy coi tệp là dạng chỉ có hình ảnh.

Ngoài ra, hãy kiểm tra trang bằng trực quan:

  • Các trang bị lệch cho thấy đây là bản quét.
  • Kết cấu giấy xám cho thấy đây là bản quét.
  • Bóng mờ gần gáy sách cho thấy đây là một cuốn sách được chụp lại bằng máy ảnh.
  • Độ tương phản không đều cho thấy đây là bản photocopy.
  • Tìm kiếm không tìm thấy các từ hiển thị cho thấy không có lớp văn bản.

Bước 2: Cải Thiện Bản Quét Nếu Có Thể

Chất lượng OCR bắt đầu từ chất lượng hình ảnh. Nếu bạn có thể quét lại, hãy làm điều đó trước khi dành thời gian sửa chữa các lỗi OCR.

Sử dụng danh sách kiểm tra chất lượng hình ảnh sau:

  • Quét ở độ phân giải đủ cao cho văn bản nhỏ.
  • Giữ cho các trang phẳng và thẳng.
  • Tránh bóng mờ ở gần gáy sách.
  • Cắt bỏ các cạnh bàn, ngón tay hoặc các chi tiết hỗn độn ở nền.
  • Sử dụng độ tương phản mạnh giữa văn bản và trang giấy.
  • Giữ cho toàn bộ dòng hiển thị rõ ràng.
  • Sử dụng đúng hướng trang.
  • Không nén hình ảnh quá mạnh khiến các chữ cái bị mờ.

Đối với sách cũ và bản photocopy, những cải thiện lớn nhất thường đến từ việc chỉnh sửa độ nghiêng, điều chỉnh độ tương phản và quét lại các trang bị mất nét.

Bước 3: Chạy OCR

Chọn một công cụ OCR dựa trên tài liệu, không phải thương hiệu.

Tùy chọn OCRPhù hợp nhất choCần lưu ý
Adobe Acrobat OCRCác bản quét doanh nghiệp nói chung và dọn dẹp PDFKiểm tra quyền truy cập gói hiện tại trước khi sử dụng.
ABBYY FineReaderCác bản quét phức tạp, bảng biểu, cột và bố cục khóVẫn yêu cầu kiểm tra thủ công.
Tesseract hoặc OCRmyPDFQuy trình OCR cục bộ, mang tính kỹ thuật và có thể lặp lạiYêu cầu sự quen thuộc với các công cụ dòng lệnh.
Các công cụ OCR trực tuyếnCác tệp ít rủi ro, mang tính thỉnh thoảngQuyền riêng tư, giới hạn tệp và chất lượng có thể thay đổi.
Ứng dụng quét trên điện thoạiChụp nhanh bản quét mớiBiến dạng phối cảnh có thể làm giảm chất lượng OCR.

Đối với các hợp đồng riêng tư, hồ sơ y tế, tài liệu tài chính, bản thảo chưa xuất bản hoặc công việc học thuật đang được xem xét, hãy ưu tiên quy trình OCR cục bộ hoặc một môi trường đáng tin cậy. Không tải các bản quét nhạy cảm lên các trang web OCR miễn phí ngẫu nhiên.

Bước 4: Xem Xét Văn Bản OCR

Kiểm tra trước khi dịch, không phải sau khi dịch. Sao chép văn bản từ một số trang khó và kiểm tra xem văn bản đó có đọc được không.

Các mẫu trang cần kiểm tra:

  • Trang tiêu đề.
  • Một trang nội dung chính dày đặc.
  • Một trang bảng biểu.
  • Một trang có chú thích chân trang.
  • Một trang có văn bản nhỏ.
  • Một trang có tem, chữ viết tay hoặc ghi chú bên lề.
  • Một trang bằng mỗi ngôn ngữ nếu tài liệu đa ngôn ngữ.

Tìm kiếm:

  • Các đoạn văn bị thiếu.
  • Các cột bị hợp nhất.
  • Các từ bị cắt đứt.
  • Các ký tự sai.
  • Các dấu phụ bị mất.
  • Nhãn bảng bị tách khỏi giá trị.
  • Tiêu đề bị chèn vào văn bản chính.
  • Số trang bị lẫn vào câu.

Nếu chất lượng OCR kém, hãy sửa nó trước khi dịch. Trình dịch không thể khôi phục đáng tin cậy ý nghĩa mà OCR chưa từng ghi lại.

Bước 5: Dịch Tệp PDF Đã Qua Xử Lý OCR

Khi tệp PDF đã có lớp văn bản sạch, hãy tải tệp lên PDF Translator. Bước dịch bây giờ có thể làm việc với văn bản thay vì hình ảnh trang.

Sau khi dịch, hãy so sánh:

  • Bản quét gốc
  • Lớp văn bản OCR
  • Tệp PDF đã dịch

Quy trình đánh giá ba chiều này giúp bạn xác định xem lỗi xuất phát từ OCR hay từ quá trình dịch. Nếu văn bản OCR sai, hãy chạy lại OCR. Nếu văn bản OCR đúng nhưng bản dịch sai, hãy sửa bản dịch.

Bước 6: Xem Xét Nội Dung Rủi Ro Cao

Các tài liệu đã quét thường chứa chính xác nội dung cần được xem xét kỹ lưỡng: hợp đồng cũ, biểu mẫu chính phủ, bài báo học thuật, sổ tay, tài liệu lịch sử và các trang sách.

Xem xét thủ công các mục sau:

  • Tên
  • Ngày tháng
  • Số
  • Địa chỉ
  • Mã sản phẩm
  • Tài liệu tham khảo pháp lý
  • Trích dẫn
  • Nhãn bảng
  • Đơn vị
  • Phương trình
  • Chú thích ảnh
  • Chú thích chân trang

Đối với các tệp nghiên cứu và học thuật, hãy đọc thêm hướng dẫn dịch các bài báo nghiên cứu học thuật, bởi vì các tệp PDF học thuật được quét sẽ bổ sung thêm rủi ro về trích dẫn và bố cục bên cạnh rủi ro OCR.

Ví Dụ Về Lỗi Xảy Ra Song Song

Sử dụng bảng này trong khi xem xét đầu ra OCR.

Bản quét gốc có khả năng hiển thịĐầu ra OCR bị lỗiTại sao điều này quan trọng
modernmodemÝ nghĩa thay đổi hoàn toàn.
Section 10Section IOCác tài liệu tham khảo pháp lý hoặc kỹ thuật có thể bị lỗi.
20262O26Ngày tháng và ID trở nên kém tin cậy.
patientpatlentCác thuật ngữ y tế hoặc kỹ thuật trở nên sai lệch.
Hai cột riêng biệtMột đoạn văn bị hợp nhấtTrình dịch đọc các câu theo sai thứ tự.
Hàng trong bảng có nhãn và giá trịMột dòng văn bản hỗn hợp duy nhấtDữ liệu không còn ánh xạ đúng nhãn.
Dấu chú thích chân trang 1Chữ cái lGhi chú có thể gắn nhầm vào câu khác.

Nếu bạn thấy những lỗi này trong lớp OCR, hãy sửa OCR trước khi dịch.

Bạn Nên Sử Dụng Công Cụ Nào?

Chọn theo mức độ khó của tài liệu.

Tài liệuCon đường được đề xuất
Bản quét doanh nghiệp sạchChạy OCR trong Acrobat hoặc một công cụ OCR đáng tin cậy khác, sau đó dùng PDF Translator.
Bản quét sách cũChỉnh sửa độ nghiêng và cải thiện độ tương phản, chạy OCR cẩn thận, sau đó dịch.
Bản quét bài báo học thuậtChạy OCR, xem xét các phương trình/trích dẫn/bảng biểu, sau đó dịch kèm đánh giá bố cục.
Ghi chú viết tayCó thể cần phiên mã thủ công trước khi dịch.
Tài liệu cá nhân đơn giảnOCR trực tuyến có thể được chấp nhận nếu rủi ro về quyền riêng tư thấp.
Tài liệu nhạy cảmSử dụng OCR cục bộ hoặc quy trình kiểm soát đáng tin cậy.

Nếu bạn muốn so sánh công cụ rộng hơn, hãy xem hướng dẫn công cụ dịch PDF tốt nhất.

Các Vấn Đề Phổ Biến Về PDF Đã Quét

Các Trang Có Độ Phân Giải Thấp

Các bản quét độ phân giải thấp làm mờ các chữ cái lại với nhau. OCR có thể nhầm lẫn giữa rnm, cld, hoặc dấu câu và bụi.

Cách khắc phục: quét lại nếu có thể. Nếu không, hãy tăng độ tương phản và thử chạy OCR lại.

Các Trang Bị Lệch Hoặc Cong

Bản quét sách thường bị cong ở gần gáy. OCR đọc các dòng bị cong kém và có thể sắp xếp lại văn bản.

Cách khắc phục: làm phẳng trang, quét lại hoặc sử dụng công cụ OCR có tính năng khử nghiêng và khử cong.

Bố Cục Nhiều Cột

OCR có thể hợp nhất cột bên trái và bên phải thành một luồng câu duy nhất.

Cách khắc phục: kiểm tra thứ tự đọc trước khi dịch. Các bài báo học thuật cần được chú ý đặc biệt ở điểm này.

Bảng Biểu

Bảng biểu rất khó vì OCR phải phát hiện cả văn bản lẫn cấu trúc. Một bảng có thể trông chính xác về mặt trực quan trong khi lớp văn bản lại sai.

Cách khắc phục: sao chép văn bản OCR từ bảng và xác nhận các nhãn vẫn khớp với các giá trị.

Chữ Viết Tay Và Chữ Ký

OCR văn bản in đáng tin cậy hơn nhiều so với nhận dạng chữ viết tay. Các ghi chú viết tay bên lề, chữ ký và các biểu mẫu được điền sẵn có thể bị bỏ sót hoặc bị bóp méo.

Cách khắc phục: phiên mã thủ công phần chữ viết tay thiết yếu trước khi dịch.

Đa Ngôn Ngữ

OCR hoạt động tốt nhất khi biết trước ngôn ngữ nguồn. Bản quét chứa tiếng Anh, tiếng Pháp và tiếng Trung có thể thất bại nếu OCR chỉ được thiết lập cho một ngôn ngữ.

Cách khắc phục: chọn tất cả các ngôn ngữ OCR liên quan nếu công cụ hỗ trợ, sau đó kiểm tra ngẫu nhiên từng phần ngôn ngữ.

Danh Sách Kiểm Tra Quyền Riêng Tư Và Bảo Mật

Trước khi tải tệp PDF đã quét lên bất kỳ đâu, hãy tự hỏi:

  • Tài liệu có chứa dữ liệu cá nhân không?
  • Tài liệu có bao gồm tài liệu y tế, pháp lý, tài chính, học thuật hoặc chưa được xuất bản không?
  • Tài liệu có bị ràng buộc bởi thỏa thuận khách hàng hoặc chính sách của trường học không?
  • Dịch vụ OCR trực tuyến có được phép sử dụng cho tài liệu này không?
  • Bạn có cần quy trình cục bộ thay thế không?
  • Bạn có thể xóa các trang không cần dịch không?

Các tệp PDF đã quét thường rất nhạy cảm vì chúng xuất phát từ hợp đồng, ID, biểu mẫu, bản nháp nghiên cứu và lưu trữ nội bộ. Hãy đối xử với các quyết định tải lên OCR theo cách tương tự như cách bạn đối xử với tài liệu gốc.

Bài viết liên quan