書譯
書譯

翻譯掃描 PDF:OCR 問題與實用解決方案

了解如何對掃描 PDF 進行 OCR 並進行翻譯、診斷常見的識別失敗問題,以及透過文件感知工作流程保留版面配置。

BookTranslator

BookTranslator Team

14 min read

快速解答:掃描 PDF 在翻譯前需要進行 OCR

若要翻譯掃描的 PDF,請先執行 OCR 將頁面圖片轉為可選取的文字。接著使用文件翻譯工具(例如 PDF 翻譯工具)來翻譯經過 OCR 處理的 PDF。如果您跳過 OCR,許多翻譯工具會將原始檔案原封不動地傳回、漏掉頁面,或是僅翻譯已經包含文字層的部分。

請使用以下工作流程:

  1. 開啟 PDF 並嘗試選取一個句子。
  2. 如果您無法選取文字,請執行 OCR。
  3. 在翻譯前檢查 OCR 文字。
  4. 將經過 OCR 處理的 PDF 上傳至 PDF 翻譯工具
  5. 檢視翻譯輸出與原始掃描檔的差異。

如果您的 PDF 已經具備可選取的文字,且問題在於保留版面配置,請參閱在不遺失格式的情況下翻譯 PDF 指南。

為什麼掃描 PDF 在翻譯工具中會失敗

掃描的 PDF 通常只是 PDF 容器內的一組頁面圖片。該頁面可能對人類而言顯示了文字,但檔案可能不包含供軟體擷取的實際文字。

這會造成一個簡單的失敗:

檔案類型翻譯工具看到的內容發生的情況
文字型 PDF文字加上版面配置資料可以立即開始翻譯。
純圖片掃描 PDF頁面圖片必須先進行 OCR。
文字覆蓋圖片 PDF掃描圖片加上隱藏的 OCR 文字層翻譯可以運作,但 OCR 錯誤會影響品質。

最實用的測試並非技術測試:

  1. 開啟 PDF。
  2. 嘗試反白顯示個別單字。
  3. 複製一個句子。
  4. 將其貼到文字編輯器中。

如果句子能正確貼上,表示該 PDF 具有文字層。如果完全無法貼上,或整個頁面表現得像一張圖片,則該 PDF 需要進行 OCR。

OCR 並非可有可無

OCR 代表光學字元辨識。它能從圖片中讀取文字並建立機器可讀取的文字。對於 PDF 翻譯而言,OCR 通常會在掃描頁面上建立一個隱形的文字層。

該文字層會成為翻譯的來源。如果 OCR 發生錯誤,翻譯就會繼承這些錯誤。

常見的 OCR 錯誤:

OCR 錯誤翻譯風險
rn 被誤讀為 m單字意思改變。
1 被誤讀為 l數字、參照或代碼變得不正確。
O 被誤讀為 0ID、公式和名稱可能會損毀。
漏掉重音符號名稱與術語變得不準確。
欄位合併句子以錯誤的順序翻譯。
表格儲存格逐列讀取錯誤資料標籤不再與數值相符。
註腳被視為正文文字引文與註解移至錯誤的上下文中。

這就是為什麼 OCR 檢查步驟如此重要。在您抽樣檢查擷取的文字之前,請勿翻譯掃描的文件。

OCR 優先工作流程

步驟 1:識別 PDF 類型

嘗試選取文字。如果選取成功,您可能不需要 OCR。如果選取失敗,請將檔案視為純圖片。

同時從視覺上檢查頁面:

  • 傾斜的頁面暗示這是掃描檔。
  • 灰色的紙張紋理暗示這是掃描檔。
  • 書脊附近的陰影暗示這是拍攝的書籍。
  • 不均勻的對比度暗示這是影印本。
  • 搜尋找不到可見的單字暗示沒有文字層。

步驟 2:盡可能改善掃描品質

OCR 品質始於圖片品質. 如果您可以重新掃描,請在花時間修復 OCR 錯誤之前進行。

使用以下圖片品質檢查清單:

  • 以足夠高的解析度掃描小字。
  • 保持頁面平坦筆直。
  • 避免書脊附近的陰影。
  • 裁切掉表格邊緣、手指或背景雜物。
  • 在文字與頁面之間保持強烈對比。
  • 保持整行文字可見。
  • 使用正確的頁面方向。
  • 請勿將圖片壓縮得太重,以免字母模糊。

對於舊書和影印本,最大的成效通常來自於去歪斜、對比度修正,以及重新掃描對焦不準的頁面。

步驟 3:執行 OCR

根據文件而非品牌來選擇 OCR 工具。

OCR 選項最適合注意事項
Adobe Acrobat OCR一般商業掃描和 PDF 清理在依賴它之前,請先檢查目前的方案存取權。
ABBYY FineReader複雜的掃描、表格、欄位和困難的版面配置仍需要手動檢查。
Tesseract 或 OCRmyPDF本機、技術性、可重複的 OCR 工作流程需要熟悉命令列工具。
線上 OCR 工具低風險的偶發檔案隱私權、檔案限制和品質會有所不同。
手機掃描應用程式快速擷取新掃描檔透視變形會損害 OCR 效能。

對於機密合約、醫療記錄、財務文件、未出版的手稿或審查中的學術著作,請優先選擇本機 OCR 工作流程或受信任的環境。請勿將敏感掃描上傳至隨機的免費 OCR 網站。

步驟 4:檢查 OCR 文字

在翻譯前進行檢查,而不是在翻譯後。從幾個困難的頁面複製文字,並檢查它是否可讀。

要檢查的範例頁面:

  • 封面頁。
  • 密集的正文頁面。
  • 表格頁面。
  • 帶有註腳的頁面。
  • 帶有小字的頁面。
  • 帶有印章、手寫文字或邊註的頁面。
  • 如果文件是多語言的,則包含每種語言的頁面。

尋找以下問題:

  • 遺漏的段落。
  • 合併的欄位。
  • 破損的單字。
  • 錯誤的字元。
  • 遺失的附加符號。
  • 與數值分離的表格標籤。
  • 插入正文中的標題。
  • 混入句子中的頁碼。

如果 OCR 品質很差,請在翻譯前進行修正。翻譯工具無法可靠地復原 OCR 從未擷取到的意義。

步驟 5:翻譯經過 OCR 處理的 PDF

一旦 PDF 擁有乾淨的文字層,請將其上傳至 PDF 翻譯工具。翻譯步驟現在可以直接處理文字,而不是頁面圖片。

翻譯後,請比較:

  • 原始掃描檔
  • OCR 文字層
  • 翻譯後的 PDF

這種三方檢查有助於您識別錯誤是來自 OCR 還是翻譯。如果 OCR 文字錯誤,請重新執行 OCR。如果 OCR 文字正確但翻譯錯誤,請修正翻譯。

步驟 6:檢查高風險內容

掃描的文件通常包含精準需要仔細檢查的內容:舊合約、政府表格、學術論文、手冊、歷史文件和書籍頁面。

手動檢查這些項目:

  • 名稱
  • 日期
  • 數字
  • 地址
  • 產品代碼
  • 法律參考資料
  • 引文
  • 表格標籤
  • 單位
  • 公式
  • 圖說
  • 註腳

對於研究和學術檔案,也請閱讀翻譯學術研究論文指南,因為掃描的學術 PDF 除了 OCR 風險外,還增加了引文和版面配置風險。

並排失敗範例

在檢查 OCR 輸出時請使用此表格。

原始掃描檔可能顯示不良的 OCR 輸出為什麼這很重要
modernmodem意思完全改變。
Section 10Section IO法律或技術參考資料可能會損毀。
20262O26日期和 ID 變得不可靠。
patientpatlent醫療或技術術語變得不正確。
兩個獨立的欄位一個合併的段落翻譯以錯誤的順序讀取句子。
包含標籤與數值的表格列混雜文字的單行資料不再對應到正確的標籤。
註腳標記 1字母 l註解可能會附加到錯誤的句子。

如果您在 OCR 層中看到這些錯誤,請在翻譯前修正 OCR。

您應該使用哪種工具?

根據文件的難易度來選擇。

文件建議的路徑
乾淨的商業掃描檔在 Acrobat 或其他可靠的 OCR 工具中進行 OCR,然後使用 PDF 翻譯工具
舊書掃描檔去歪斜並改善對比度,小心進行 OCR,然後進行翻譯。
學術論文掃描檔進行 OCR、檢查公式/引文/表格,然後透過版面配置檢閱進行翻譯。
手寫筆記在翻譯之前可能需要手動抄寫。
簡單的個人文件如果隱私風險低,線上 OCR 可能是可接受的。
敏感文件使用本機 OCR 或受信任的受控工作流程。

如果您想要更廣泛的工具比較,請參閱最佳 PDF 翻譯工具指南

常見的掃描 PDF 問題

低解析度頁面

低解析度掃描會使字母模糊不清。OCR 可能會混淆 rnmcld,或是標點符號與灰塵。

修正方式:如果可能的話請重新掃描。如果不行,請增加對比度並再次嘗試 OCR。

傾斜或彎曲的頁面

書籍掃描通常會在書脊附近彎曲。OCR 對彎曲線條的讀取效果很差,且可能會重新排序文字。

修正方式:將頁面壓平、重新掃描,或使用具備去歪斜和去曲功能的 OCR 工具。

多欄版面配置

OCR 可能會將左右欄合併為一個句子串流。

修正方式:在翻譯前檢查閱讀順序。學術論文在這裡需要特別注意。

表格

表格很難處理,因為 OCR 必須同時偵測文字和結構。表格在視覺上可能看起來正確,但文字層卻是錯誤的。

修正方式:從表格複製 OCR 文字,並確認標籤仍然與數值相符。

手寫與簽名

印刷文字的 OCR 比手寫辨識可靠得多。手寫的邊註、簽名和填寫的表格可能會被漏掉或亂碼。

修正方式:在翻譯前手動抄寫重要的手寫文字。

混合語言

OCR 在知道來源語言時效果最好。如果 OCR 僅設定為單一語言,包含英文、法文和中文的掃描可能會失敗。

修正方式:如果工具支援,請選擇所有相關的 OCR 語言,然後抽樣檢查每個語言區段。

隱私權與安全性檢查清單

在任何地方上傳掃描的 PDF 之前,請先詢問:

  • 文件是否包含個人資料?
  • 它是否包含醫療、法律、財務、學術或未出版的資料?
  • 它是否受到客戶協議或學校政策的約束?
  • 針對此文件是否允許使用線上 OCR 服務?
  • 您是否需要改用本機工作流程?
  • 您是否可以移除不需要翻譯的頁面?

掃描的 PDF 通常很敏感,因為它們來自合約、身分證、表格、研究草稿和內部檔案。請以對待原始文件相同的態度來對待 OCR 上傳決策。

相關文章