翻譯掃描 PDF:OCR 問題與實用解決方案
了解如何對掃描 PDF 進行 OCR 並進行翻譯、診斷常見的識別失敗問題,以及透過文件感知工作流程保留版面配置。

快速解答:掃描 PDF 在翻譯前需要進行 OCR
若要翻譯掃描的 PDF,請先執行 OCR 將頁面圖片轉為可選取的文字。接著使用文件翻譯工具(例如 PDF 翻譯工具)來翻譯經過 OCR 處理的 PDF。如果您跳過 OCR,許多翻譯工具會將原始檔案原封不動地傳回、漏掉頁面,或是僅翻譯已經包含文字層的部分。
請使用以下工作流程:
- 開啟 PDF 並嘗試選取一個句子。
- 如果您無法選取文字,請執行 OCR。
- 在翻譯前檢查 OCR 文字。
- 將經過 OCR 處理的 PDF 上傳至 PDF 翻譯工具。
- 檢視翻譯輸出與原始掃描檔的差異。
如果您的 PDF 已經具備可選取的文字,且問題在於保留版面配置,請參閱在不遺失格式的情況下翻譯 PDF 指南。
為什麼掃描 PDF 在翻譯工具中會失敗
掃描的 PDF 通常只是 PDF 容器內的一組頁面圖片。該頁面可能對人類而言顯示了文字,但檔案可能不包含供軟體擷取的實際文字。
這會造成一個簡單的失敗:
| 檔案類型 | 翻譯工具看到的內容 | 發生的情況 |
|---|---|---|
| 文字型 PDF | 文字加上版面配置資料 | 可以立即開始翻譯。 |
| 純圖片掃描 PDF | 頁面圖片 | 必須先進行 OCR。 |
| 文字覆蓋圖片 PDF | 掃描圖片加上隱藏的 OCR 文字層 | 翻譯可以運作,但 OCR 錯誤會影響品質。 |
最實用的測試並非技術測試:
- 開啟 PDF。
- 嘗試反白顯示個別單字。
- 複製一個句子。
- 將其貼到文字編輯器中。
如果句子能正確貼上,表示該 PDF 具有文字層。如果完全無法貼上,或整個頁面表現得像一張圖片,則該 PDF 需要進行 OCR。
OCR 並非可有可無
OCR 代表光學字元辨識。它能從圖片中讀取文字並建立機器可讀取的文字。對於 PDF 翻譯而言,OCR 通常會在掃描頁面上建立一個隱形的文字層。
該文字層會成為翻譯的來源。如果 OCR 發生錯誤,翻譯就會繼承這些錯誤。
常見的 OCR 錯誤:
| OCR 錯誤 | 翻譯風險 |
|---|---|
rn 被誤讀為 m | 單字意思改變。 |
1 被誤讀為 l | 數字、參照或代碼變得不正確。 |
O 被誤讀為 0 | ID、公式和名稱可能會損毀。 |
| 漏掉重音符號 | 名稱與術語變得不準確。 |
| 欄位合併 | 句子以錯誤的順序翻譯。 |
| 表格儲存格逐列讀取錯誤 | 資料標籤不再與數值相符。 |
| 註腳被視為正文文字 | 引文與註解移至錯誤的上下文中。 |
這就是為什麼 OCR 檢查步驟如此重要。在您抽樣檢查擷取的文字之前,請勿翻譯掃描的文件。
OCR 優先工作流程
步驟 1:識別 PDF 類型
嘗試選取文字。如果選取成功,您可能不需要 OCR。如果選取失敗,請將檔案視為純圖片。
同時從視覺上檢查頁面:
- 傾斜的頁面暗示這是掃描檔。
- 灰色的紙張紋理暗示這是掃描檔。
- 書脊附近的陰影暗示這是拍攝的書籍。
- 不均勻的對比度暗示這是影印本。
- 搜尋找不到可見的單字暗示沒有文字層。
步驟 2:盡可能改善掃描品質
OCR 品質始於圖片品質. 如果您可以重新掃描,請在花時間修復 OCR 錯誤之前進行。
使用以下圖片品質檢查清單:
- 以足夠高的解析度掃描小字。
- 保持頁面平坦筆直。
- 避免書脊附近的陰影。
- 裁切掉表格邊緣、手指或背景雜物。
- 在文字與頁面之間保持強烈對比。
- 保持整行文字可見。
- 使用正確的頁面方向。
- 請勿將圖片壓縮得太重,以免字母模糊。
對於舊書和影印本,最大的成效通常來自於去歪斜、對比度修正,以及重新掃描對焦不準的頁面。
步驟 3:執行 OCR
根據文件而非品牌來選擇 OCR 工具。
| OCR 選項 | 最適合 | 注意事項 |
|---|---|---|
| Adobe Acrobat OCR | 一般商業掃描和 PDF 清理 | 在依賴它之前,請先檢查目前的方案存取權。 |
| ABBYY FineReader | 複雜的掃描、表格、欄位和困難的版面配置 | 仍需要手動檢查。 |
| Tesseract 或 OCRmyPDF | 本機、技術性、可重複的 OCR 工作流程 | 需要熟悉命令列工具。 |
| 線上 OCR 工具 | 低風險的偶發檔案 | 隱私權、檔案限制和品質會有所不同。 |
| 手機掃描應用程式 | 快速擷取新掃描檔 | 透視變形會損害 OCR 效能。 |
對於機密合約、醫療記錄、財務文件、未出版的手稿或審查中的學術著作,請優先選擇本機 OCR 工作流程或受信任的環境。請勿將敏感掃描上傳至隨機的免費 OCR 網站。
步驟 4:檢查 OCR 文字
在翻譯前進行檢查,而不是在翻譯後。從幾個困難的頁面複製文字,並檢查它是否可讀。
要檢查的範例頁面:
- 封面頁。
- 密集的正文頁面。
- 表格頁面。
- 帶有註腳的頁面。
- 帶有小字的頁面。
- 帶有印章、手寫文字或邊註的頁面。
- 如果文件是多語言的,則包含每種語言的頁面。
尋找以下問題:
- 遺漏的段落。
- 合併的欄位。
- 破損的單字。
- 錯誤的字元。
- 遺失的附加符號。
- 與數值分離的表格標籤。
- 插入正文中的標題。
- 混入句子中的頁碼。
如果 OCR 品質很差,請在翻譯前進行修正。翻譯工具無法可靠地復原 OCR 從未擷取到的意義。
步驟 5:翻譯經過 OCR 處理的 PDF
一旦 PDF 擁有乾淨的文字層,請將其上傳至 PDF 翻譯工具。翻譯步驟現在可以直接處理文字,而不是頁面圖片。
翻譯後,請比較:
- 原始掃描檔
- OCR 文字層
- 翻譯後的 PDF
這種三方檢查有助於您識別錯誤是來自 OCR 還是翻譯。如果 OCR 文字錯誤,請重新執行 OCR。如果 OCR 文字正確但翻譯錯誤,請修正翻譯。
步驟 6:檢查高風險內容
掃描的文件通常包含精準需要仔細檢查的內容:舊合約、政府表格、學術論文、手冊、歷史文件和書籍頁面。
手動檢查這些項目:
- 名稱
- 日期
- 數字
- 地址
- 產品代碼
- 法律參考資料
- 引文
- 表格標籤
- 單位
- 公式
- 圖說
- 註腳
對於研究和學術檔案,也請閱讀翻譯學術研究論文指南,因為掃描的學術 PDF 除了 OCR 風險外,還增加了引文和版面配置風險。
並排失敗範例
在檢查 OCR 輸出時請使用此表格。
| 原始掃描檔可能顯示 | 不良的 OCR 輸出 | 為什麼這很重要 |
|---|---|---|
modern | modem | 意思完全改變。 |
Section 10 | Section IO | 法律或技術參考資料可能會損毀。 |
2026 | 2O26 | 日期和 ID 變得不可靠。 |
patient | patlent | 醫療或技術術語變得不正確。 |
| 兩個獨立的欄位 | 一個合併的段落 | 翻譯以錯誤的順序讀取句子。 |
| 包含標籤與數值的表格列 | 混雜文字的單行 | 資料不再對應到正確的標籤。 |
註腳標記 1 | 字母 l | 註解可能會附加到錯誤的句子。 |
如果您在 OCR 層中看到這些錯誤,請在翻譯前修正 OCR。
您應該使用哪種工具?
根據文件的難易度來選擇。
| 文件 | 建議的路徑 |
|---|---|
| 乾淨的商業掃描檔 | 在 Acrobat 或其他可靠的 OCR 工具中進行 OCR,然後使用 PDF 翻譯工具。 |
| 舊書掃描檔 | 去歪斜並改善對比度,小心進行 OCR,然後進行翻譯。 |
| 學術論文掃描檔 | 進行 OCR、檢查公式/引文/表格,然後透過版面配置檢閱進行翻譯。 |
| 手寫筆記 | 在翻譯之前可能需要手動抄寫。 |
| 簡單的個人文件 | 如果隱私風險低,線上 OCR 可能是可接受的。 |
| 敏感文件 | 使用本機 OCR 或受信任的受控工作流程。 |
如果您想要更廣泛的工具比較,請參閱最佳 PDF 翻譯工具指南。
常見的掃描 PDF 問題
低解析度頁面
低解析度掃描會使字母模糊不清。OCR 可能會混淆 rn 與 m、cl 與 d,或是標點符號與灰塵。
修正方式:如果可能的話請重新掃描。如果不行,請增加對比度並再次嘗試 OCR。
傾斜或彎曲的頁面
書籍掃描通常會在書脊附近彎曲。OCR 對彎曲線條的讀取效果很差,且可能會重新排序文字。
修正方式:將頁面壓平、重新掃描,或使用具備去歪斜和去曲功能的 OCR 工具。
多欄版面配置
OCR 可能會將左右欄合併為一個句子串流。
修正方式:在翻譯前檢查閱讀順序。學術論文在這裡需要特別注意。
表格
表格很難處理,因為 OCR 必須同時偵測文字和結構。表格在視覺上可能看起來正確,但文字層卻是錯誤的。
修正方式:從表格複製 OCR 文字,並確認標籤仍然與數值相符。
手寫與簽名
印刷文字的 OCR 比手寫辨識可靠得多。手寫的邊註、簽名和填寫的表格可能會被漏掉或亂碼。
修正方式:在翻譯前手動抄寫重要的手寫文字。
混合語言
OCR 在知道來源語言時效果最好。如果 OCR 僅設定為單一語言,包含英文、法文和中文的掃描可能會失敗。
修正方式:如果工具支援,請選擇所有相關的 OCR 語言,然後抽樣檢查每個語言區段。
隱私權與安全性檢查清單
在任何地方上傳掃描的 PDF 之前,請先詢問:
- 文件是否包含個人資料?
- 它是否包含醫療、法律、財務、學術或未出版的資料?
- 它是否受到客戶協議或學校政策的約束?
- 針對此文件是否允許使用線上 OCR 服務?
- 您是否需要改用本機工作流程?
- 您是否可以移除不需要翻譯的頁面?
掃描的 PDF 通常很敏感,因為它們來自合約、身分證、表格、研究草稿和內部檔案。請以對待原始文件相同的態度來對待 OCR 上傳決策。





