EPUB vs PDF:哪種格式翻譯效果更好?
EPUB 儲存的是乾淨的段落。PDF 儲存的是定位後的字元。這份技術拆解說明了,為什麼同一個 AI 在兩者上的結果會截然不同。

快速答案:對書籍來說,EPUB 通常翻譯得更好;當版面本身就是文件內容時,PDF 更適合
如果同一本書同時有 EPUB 和 PDF,翻譯時請選 EPUB。EPUB 會以可保留的結構儲存章節、段落、標題、連結、圖片、CSS,以及目錄資料。PDF 儲存的是固定頁面版面,因此翻譯器必須先重建閱讀順序,才能開始翻譯。
這不代表 PDF 很差。當精確頁面版式很重要時,PDF 才是正確的來源格式:學術論文、表單、證書、掃描文件、報告、手冊,以及帶有複雜表格或圖表的文件。
可以用這個判斷規則:
- 小說、非虛構書籍、教科書,以及電子閱讀器閱讀:先用 EPUB 翻譯。
- 固定版面文件、掃描檔、表單,以及學術 PDF:先用 PDF 翻譯。
- Kindle 書籍:先把無 DRM 的 Kindle 檔轉成 EPUB,再翻譯 EPUB。
如果你在決定使用 EPUB 之後,還需要一份工具候選清單,請讀 最佳 EPUB 翻譯工具比較。如果你真正的問題是如何保留 PDF 版面,請讀 如何在不破壞格式的情況下翻譯 PDF。
EPUB 與 PDF 翻譯對比:決策表
| 翻譯因素 | EPUB | 更佳預設選擇 | |
|---|---|---|---|
| 文字擷取 | 乾淨的章節與段落標記 | 從定位文字重建 | EPUB |
| 閱讀順序 | 通常在書籍 spine 中明確定義 | 必須從頁面版面推斷 | EPUB |
| 目錄 | 結構化導覽檔案 | 可選的書籤或頁碼參照 | EPUB |
| CSS 與樣式 | 可保留獨立樣式表 | 樣式綁定在固定頁面位置 | EPUB |
| 圖片與說明文字 | 圖片位於內容流程中 | 圖片與文字共享同一個平面頁面 | 書籍選 EPUB,固定頁面選 PDF |
| 腳註與尾註 | 可保留內部連結 | 註釋可能依賴頁面位置 | EPUB |
| 譯文變長 | 可自然重排 | 必須塞進固定頁面區域 | EPUB |
| 掃描頁面 | 不是常見來源格式 | 常見來源格式,但需要 OCR | |
| 表單與證書 | 不適合 | 本來就是為固定版面設計 | |
| 電子閱讀器體驗 | 可重排、可調整 | 固定頁面,在小螢幕上通常較難讀 | EPUB |
| 轉換風險 | 若原本就是 EPUB,通常很低 | PDF 轉 EPUB 可能破壞版面 | 視來源而定 |
為什麼 EPUB 通常能產生更乾淨的書籍翻譯
EPUB 與其說像印刷頁面,不如說更接近一個小型網站。在檔案內部,一本書通常由 XHTML 章節檔、CSS 樣式表、圖片資產、中繼資料與導覽檔組成。這種結構會給翻譯軟體一張乾淨的書籍地圖。
對翻譯來說,這很重要,因為工具可以:
- 擷取完整段落,而不是猜測哪些行屬於同一段。
- 翻譯章節標題與導覽項目。
- 保留 CSS,而不是從頭重建版面。
- 讓圖片維持在閱讀流程中。
- 保留腳註與其參照之間的連結。
- 在翻譯後重新組裝成真正的電子書檔案。
這就是為什麼 EPUB 通常是小說、敘事型非虛構、教科書、手冊,以及長篇閱讀內容的更佳來源。工具可以把精力放在翻譯品質上,而不是先解決版面重建問題。
為什麼 PDF 翻譯更困難
PDF 的設計目的是保留視覺外觀。它回答的是另一個問題:每個元素應該出現在頁面的哪裡?這對列印與需要精確版面的文件很有用,但也帶來了翻譯上的挑戰。
處理 PDF 的翻譯工具可能必須推斷:
- 哪些文字屬於正文。
- 哪些行屬於同一個段落。
- 頁面是一欄還是多欄。
- 某個數字是腳註標記、清單編號、頁碼,還是表格數值。
- 文字是可選取文字,還是掃描圖片的一部分。
- 譯文變長或變短後,應該放進哪個位置。
這些問題都能解決,但不是沒有代價。即使是很強的 AI 模型,如果輸入文字是以錯誤順序被擷取,或混入頁首、頁尾、註釋、相鄰欄位,輸出品質也會明顯變差。
真正造成翻譯差異的是輸入品質
AI 模型並不知道文字是來自 EPUB 還是 PDF。它看到的只有文字。格式之所以重要,是因為它會改變最終送進模型的文字品質。
實際差異如下:
| 流程步驟 | EPUB 風險 | PDF 風險 |
|---|---|---|
| 辨識段落 | 低,因為段落有標記 | 中,因為段落必須重建 |
| 保持閱讀順序 | 低,因為章節順序已定義 | 中到高,特別是在多欄、側欄與表格中 |
| 保留標題 | 低,因為標題本身就是標記 | 中,因為標題只是視覺樣式 |
| 保留註釋 | 中,如果錨點被錯誤改寫 | 中到高,尤其是頁面註釋 |
| 處理圖片 | 低,對一般行內圖片來說 | 中,當文字與圖片重疊時 |
| 讓較長譯文重排 | 低,因為 EPUB 本來就會自動重排 | 高,因為 PDF 文字框是固定的 |
如果你發現翻譯後的 PDF 看起來比翻譯後的 EPUB 更差,原因通常不是「翻譯很差」,而是擷取很差、切分很差,或固定版面本身帶來的限制。
什麼時候 EPUB 是更好的來源
當內容主要是為了連續閱讀而設計時,請選 EPUB。
適合 EPUB 翻譯的內容:
- 小說與短篇小說集。
- 敘事型非虛構作品。
- 商業書。
- 以流動文字為主的教科書。
- 語言學習書籍。
- 不依賴精確頁面幾何的手冊。
- 轉換成 EPUB 後的無 DRM Kindle 書籍。
- 預計在 Kindle、Kobo、Apple Books、Google Play Books,或手機上閱讀的書籍。
當目標語言會改變文字長度時,EPUB 特別有用。可重排的文字會讓譯文自然適應,而不是強迫每個段落塞回原本的頁面框中。
如果你的來源本來就是 EPUB,請直接使用專門的 EPUB 翻譯器。
什麼時候 PDF 是更好的來源
當頁面版面本身承載資訊時,請選 PDF。
適合 PDF 翻譯的內容:
- 帶有多欄、圖表、公式、引用與頁碼參照的學術論文。
- 需要 OCR 的掃描文件。
- 政府表單與證書。
- 頁面版式很重要的法律文件。
- 財務報表與年報。
- 圖示位置必須精確的手冊。
- 匯出為 PDF 的簡報。
- 讀者預期要逐頁對應的文件。
對這些檔案來說,轉成 EPUB 反而可能破壞文件最有價值的部分。請直接用具備版面意識的 PDF 翻譯器 處理 PDF,然後再檢查表格、圖表、腳註與頁碼參照。
翻譯前應該先把 PDF 轉成 EPUB 嗎?
有時候應該。有些 PDF 其實只是被困在固定頁面格式裡的一本書,先轉成 EPUB 會讓翻譯更順利;但如果 PDF 依賴精確版面,轉換也可能讓輸出更糟。
以下情況可以先轉 PDF 為 EPUB:
- PDF 是文字型,不是掃描檔。
- 內容大多是連續散文。
- 你打算在電子閱讀器或手機上閱讀。
- 你不需要保留精確的原始頁碼。
- 表格、表單、多欄與圖表很少。
以下情況不要先轉換:
- PDF 是掃描檔,而且需要 OCR。
- 文件有多欄的學術版面。
- 頁碼、表單、印章或簽名很重要。
- 表格、公式或圖表需要精確定位。
- PDF 本來就是使用者預期的最終版面。
如果你要轉換,請用 Calibre 或其他電子書轉換流程,並在翻譯前先檢查 EPUB。不要因為成功生成了一個檔案,就假設轉換一定沒問題。
10 分鐘格式測試
如果你不確定,先做這個小測試,再決定是否翻完整份文件。
- 挑 3 個具代表性的區段:一頁普通頁面、一頁帶圖或表格的頁面,以及一頁帶註釋或連結的頁面。
- 如果你同時有 EPUB 與 PDF 版本,請用兩種格式翻譯相同區段。
- 在電子閱讀器或電子書 App 中打開 EPUB 輸出。
- 在 PDF 閱讀器中打開 PDF 輸出。
- 檢查閱讀順序、標題、註釋、圖片與文字溢出情況。
- 選擇那個在你實際閱讀裝置上需要最少清理工作的格式。
對書籍來說,EPUB 的結果通常會勝出。對那些版面本身就是重點的文件來說,PDF 的結果通常會勝出。
各格式常見失敗模式
EPUB 的失敗模式
- 工具雖然翻了文字,卻把 EPUB 封裝結構弄丟了。
- ToC 錨點被錯誤改寫。
- CSS 被移除,讓章節看起來像純文字。
- 腳註連結不再能來回跳轉。
- 固定版面的 EPUB 區段無法很好地適應較長的譯文。
- 圖片中的文字沒有被翻譯,因為它本來就是圖片的一部分。
PDF 的失敗模式
- 多欄文字以錯誤順序被讀取。
- 頁首或頁尾被併入正文。
- 腳註標記被接到錯誤句子上。
- 表格在翻譯後失去對齊。
- 較長的譯文從固定文字框中溢出。
- 掃描頁面產生 OCR 錯誤。
- 書籤與翻譯後文件不再對應。
這些是不同類型的問題,所以正確的格式選擇應該先於工具選擇。
依使用情境比較 EPUB 與 PDF
| 使用情境 | 更佳來源格式 | 原因 |
|---|---|---|
| 用另一種語言閱讀小說 | EPUB | 段落乾淨,且適合可重排閱讀 |
| 翻譯 Kindle 書籍 | 轉換後的 EPUB | Kindle 檔通常需要走無 DRM 的 EPUB 流程 |
| 翻譯學術文章 | 引用、圖表與版面通常都很重要 | |
| 翻譯掃描書籍 | 帶 OCR 的 PDF | 掃描內容必須先被辨識,才能翻譯 |
| 在手機上閱讀 | EPUB | 可重排文字比較容易閱讀 |
| 保留表單 | 固定欄位與頁面幾何很重要 | |
| 翻譯教科書 | 有 EPUB 就用 EPUB,版面很重就用 PDF | 取決於圖表、表格與公式 |
| 自行出版翻譯版 | EPUB 或原始稿件 | 你需要一套乾淨、可編輯的出版流程 |
Kindle 檔案還多了一步
Kindle 書籍通常不是直接交給翻譯工具處理。實際流程通常是:
- 先確認你是否有權基於預期用途翻譯這本書。
- 只處理無 DRM 的檔案,或法律允許你轉換的檔案。
- 用 Calibre 把 Kindle 檔轉成 EPUB。
- 檢查 EPUB 的章節結構、目錄、圖片與註釋。
- 翻譯 EPUB。
- 把翻譯後的檔案送回 Kindle,或改在其他 EPUB App 中閱讀。
如果你的來源檔是 AZW3、KFX、MOBI,或其他 Kindle 格式,請閱讀完整的 Kindle 翻譯流程。
先選格式,再選翻譯器
當你確定正確的來源格式之後,再來選工具:
- 如果來源是 EPUB,使用 書譯的 EPUB 翻譯器。
- 如果來源是 PDF,使用 書譯的 PDF 翻譯器。
- 如果你正在比較 EPUB 工具,請讀 7 款最佳 EPUB 翻譯工具。
- 如果你的 PDF 版面一直被破壞,請讀 翻譯 PDF 且不丟失格式。
- 如果你的來源是 Kindle,請遵循 Kindle 轉 EPUB 流程。
常見問題
EPUB 一定比 PDF 更適合翻譯嗎?
不一定。對書籍與長篇閱讀來說,EPUB 通常更好;但當固定版面很重要時,例如表單、學術論文、掃描文件、證書,以及版面密集型報告,PDF 會更合適。
為什麼 EPUB 比 PDF 更容易翻譯?
EPUB 提供的是結構化的章節與段落;PDF 提供的是固定的頁面位置。使用 EPUB 時,工具可以直接翻譯有意義的文字單位;使用 PDF 時,工具往往得先重建文字結構,才能開始翻譯。
我可以把 PDF 當成 EPUB 來翻譯嗎?
可以,前提是你先把 PDF 轉成 EPUB。這對文字量大的書籍效果最好,對掃描檔、表單、多欄、表格,以及頁面版式很重要的文件則效果較差。翻譯前一定要先檢查轉換後的 EPUB。
我可以把 EPUB 轉成 PDF 來翻譯嗎?
如果你最後需要固定版面的檔案,可以在翻譯後再把 EPUB 轉成 PDF;但作為工作格式,EPUB 通常更好。先翻譯 EPUB、檢查結果,再在最終流程確實需要時才匯出成 PDF。
哪種格式更適合 Kindle 翻譯?
EPUB 通常是更好的工作格式。無 DRM 的 Kindle 檔通常可以先轉成 EPUB、完成翻譯,再送回 Kindle。詳見 Kindle 翻譯指南。
哪種格式更適合保留格式?
對可重排的書籍來說,EPUB 更能保留閱讀結構;對固定頁面的文件來說,PDF 更能保留原始頁面設計。正確答案取決於你說的「格式」指的是書籍結構,還是精確頁面版面。
結論
當目標是得到一本可讀的譯本書籍時,請選 EPUB。當精確頁面本身就是內容的一部分時,請選 PDF。如果你兩種格式都有,請先翻譯 EPUB。如果你只有 PDF,先判斷它是一本可轉換的書籍型文字,還是一份應該維持 PDF 的重版面檔案。
格式選擇要先於翻譯工具選擇。來源格式一旦選錯,即使是很好的 AI 模型,也得先跟檔案本身搏鬥。





