BookTranslator
BookTranslator

EPUB 対 PDF:フォーマット、読書体験、そして翻訳

本の形式を選ぶ前に、EPUBとPDFのリフロー、レイアウト、アクセシビリティ、リーダー端末、編集、そして翻訳の観点から比較します。

BookTranslator

BookTranslator Team

22 min read

クイックアン답:本なら通常EPUBの方が翻訳品質が高く、レイアウトがドキュメントそのものである場合はPDFが勝る

同じ本がEPUBとPDFの両方で入手可能な場合は、翻訳用としてEPUBを選択してください。EPUBは、章、段落、見出し、リンク、画像、CSS、目次データを翻訳ツールが保持できる構造で格納します。一方、PDFは固定されたページレイアウトを格納するため、翻訳ツールは翻訳を行う前にまず読書順序を再構築する必要があります。

だからといってPDFが劣っているわけではありません。学術論文、フォーム、証明書、スキャンされた文書、レポート、マニュアル、複雑な表や図表を含む文書など、正確なページレイアウトが重要な場合にはPDFが最適なソースとなります。

次の判断基準を使用してください:

  • 小説、ノンフィクション、教科書、電子書籍リーダーでの読書の場合:EPUB翻訳から始めてください。
  • 固定レイアウトの文書、スキャン、フォーム、学術用PDFの場合:PDF翻訳から始めてください。
  • Kindle本の場合:DRMフリーのKindleファイルをまずEPUBに変換してから、そのEPUBを翻訳してください。

EPUBに決定した後のワークフローが必要な場合は、無料のEPUB翻訳ガイドから始めてください。実際の課題がPDFのレイアウト保持である場合は、フォーマットを失わずにPDFを翻訳する方法をお読みください。

翻訳の枠を超えたEPUBとPDFの比較

フォーマットの決定は、翻訳が関係しない日常の読書体験にも影響を与えます。

読者のニーズEPUBPDF
フォントサイズや書体の変更通常、読書アプリでサポートされています通常、ページ全体がズームされます
スマホでの快適な読書スクリーン幅に合わせてリフローしますズームや水平方向のスクロールが必要になることが多い
正確なページデザインの維持リフロー可能な本では弱い強い:すべての読者が同じページジオメトリを表示します
安定したページ番号の引用位置がフォントや画面設定によって変わる可能性がある安定したページ番号
スクリーンリーダーによるナビゲーションセマンティックな見出しや読書順序がうまく機能する場合があるタグや正しい読書順序に強く依存します
あらゆる場所で同じレイアウトで印刷主な目的ではありません一貫した印刷のために設計されています
文書ワークフローでのアノテーション電子書籍アプリとそのエクスポートオプションに依存しますPDFリーダーで広くサポートされています
新しい文字体系や長いテキストへの適応リフローにより拡張に対応します固定されたテキスト領域から溢れる可能性があります

適応型で長文の読書にはEPUBを選択してください。フォーム、ファクシミリ、論文、図解マニュアル、デザインされたレポート、印刷用エディションなど、ページ自体がコンテンツの一部である場合はPDFを選択してください。どちらのフォーマットが普遍的に優れているということはなく、それぞれ異なるものを保持します。

アクセシビリティも、拡張子だけでなくファイルの品質に依存します。適切に構造化されたEPUBは、見出し、ランドマーク、代替テキスト、論理的な読書順序を公開できます。適切にタグ付けされたPDFも、ページの忠実度を維持しながら同じことができます。不適切に生成されたEPUBやタグ付けされていないスキャンは、フォーマットに関係なくアクセスしにくくなります。

翻訳におけるEPUB対PDF:比較表

翻訳の要素EPUBPDFより良いデフォルト
テキスト抽出クリーンな章と段落のマークアップ配置されたテキストから再構築EPUB
読書順序通常、ブックのスパインで明示されているページレイアウトから推論する必要があるEPUB
目次構造化されたナビゲーションファイルオプションのブックマークまたはページ参照EPUB
CSSとスタイリング個別のスタイルシートを保持できるスタイリングが固定されたページ位置に結び付けられているEPUB
画像とキャプション画像がコンテンツのフロー内に配置される画像とテキストがフラットなページキャンバスを共有する本の場合はEPUB、固定ページの場合はPDF
脚注と巻末注内部リンクを保持できる注釈がページ位置に依存する場合があるEPUB
テキストの拡張自然にリフローする固定されたページ領域に収める必要があるEPUB
スキャンされたページ通常のソースフォーマットではない一般的なソースフォーマット、OCRが必要PDF
フォームと証明書不向き固定レイアウト用に設計されているPDF
電子書籍リーダーの体験リフロー可能で調整可能固定ページ、小さな画面では難しくなることが多いEPUB
変換リスクすでにEPUBであれば通常は低いPDFからEPUBへの変換でレイアウトが破損する可能性があるソースに依存する

なぜEPUBの方がクリーンな本の翻訳を生み出しやすいのか

EPUBは、印刷されたページというよりも小さなウェブサイトに似ています。ファイル内部では、本は通常、XHTMLの章ファイル、CSSスタイルシート、画像アセット、メタデータ、ナビゲーションファイルで構成されています。その構造により、翻訳ソフトウェアに本のクリーンなマップが提供されます。

翻訳においてそれが重要である理由は、ツールが次の処理を行えるからです:

  • 行の所属先を推測するのではなく、完全な段落を抽出する。
  • 章のタイトルやナビゲーションエントリを翻訳する。
  • レイアウトを最初から再構築するのではなく、CSSを保持する。
  • 読書の流れの中に画像を保持する。
  • 脚注とその参照間のリンクを保持する。
  • 翻訳後にファイルを実際の電子書籍として再アセンブルする。

これが、小説、物語形式のノンフィクション、教科書、マニュアル、長文の読書において、EPUBが通常より優れたソースとなる理由です。ツールは、最初にレイアウト再構築の問題を解決するのではなく、翻訳品質に集中できます。

なぜPDF翻訳は難しいのか

PDFは、視覚的な外観を保持するように設計されています。「各要素がページ上のどこに配置されるべきか?」という別の問いに答えます。これは印刷や正確なレイアウトが必要な文書には有用ですが、翻訳の課題を生み出します。

PDFを処理する翻訳ツールは、次の事項を推測する必要がある場合があります:

  • どのテキストがメイン本文に属しているか。
  • どの行が同じ段落に属しているか。
  • ページが1カラムかマルチカラムか。
  • 数値が脚注マーカー、リスト番号、ページ番号、または表の値のどれであるか。
  • テキストが選択可能か、スキャンされた画像の一部か。
  • 翻訳されたテキストが長くなったり短くなったりしたときにどこに収まるべきか。

これらの問題は解決可能ですが、簡単ではありません。強力なAIモデルであっても、入力テキストの抽出順序が間違っていたり、ヘッダー、フッター、注釈、隣接するカラムと混ざり合っていたりすると、出力の品質が低下します。

真の翻訳の違いは入力品質にある

AIモデルは、テキストがEPUBから来たのかPDFから来たのかを認識しません。認識するのはテキストだけです。フォーマットが重要なのは、モデルに届くテキストの品質を変化させるためです。

実際の違いは次のとおりです:

パイプラインのステップEPUBのリスクPDFのリスク
段落の特定低い(段落にタグが付けられているため)中程度(段落を再構築する必要があるため)
読書順序の維持低い(章の順序が定義されているため)カラム、サイドバー、表において中程度から高い
見出しの保持低い(見出しがマークアップであるため)中程度(見出しが視覚的なスタイリングであるため)
注釈の保持中程度(アンカーの書き換えが不十分な場合)中程度から高い(特にページ注釈がある場合)
画像の処理通常のインライン画像の場合は低いテキストが画像と重なっている場合は中程度
長いテキストのリフロー低い(EPUBはリフローするため)高い(PDFのボックスが固定されているため)

翻訳されたPDFの見た目が翻訳されたEPUBよりも悪い場合、その原因は多くの場合「悪い翻訳」ではありません。それは、悪い抽出、悪いセグメンテーション、または固定レイアウトの制約です。

EPUBがより良いソースとなる場合

コンテンツが主に継続して読まれることを意図している場合は、EPUBを選択してください。

EPUB翻訳の優れた候補:

  • 小説および短編小説集。
  • 物語形式のノンフィクション。
  • ビジネス書。
  • 主に流れるようなテキストで構成される教科書。
  • 語学学習本。
  • 正確なページジオメトリに依存しないマニュアル。
  • EPUBに変換した後のDRMフリーのKindle本。
  • Kindle、Kobo、Apple Books、Google Play Books、またはスマホでの読書を想定した本。

EPUBは、ターゲット言語によってテキストの長さが変わる場合に特に役立ちます。リフロー可能なテキストにより、すべての段落をもとのページボックスに無理に戻すのではなく、翻訳された本が自然に適応できるようになります。

ソースがすでにEPUBの場合は、専用のEPUB翻訳ツールから始めてください。

PDFがより良いソースとなる場合

ページレイアウトに意味が込められている場合は、PDFを選択してください。

PDF翻訳の優れた候補:

  • カラム、図、数式、引用、ページ参照を含む学術論文。
  • OCRを必要とするスキャンされた文書。
  • 政府のフォームや証明書。
  • ページレイアウトが重要な法的文書。
  • 財務レポートやアニュアルレポート。
  • 正確な図解の配置が必要なマニュアル。
  • PDFとして書き出されたプレゼンテーション。
  • 読者がページごとの一致を期待する文書。

これらのファイルの場合、EPUBに変換すると、文書の有用性を形作っている要素が損なわれる可能性があります。レイアウトを認識するPDF翻訳ツールを使用してPDFを直接翻訳し、その後で表、図、脚注、ページ参照を点検してください。

翻訳前にPDFをEPUBに変換すべきか?

場合によります。PDFが実際には固定ページ形式に閉じ込められた本である場合、PDFからEPUBへの変換によって翻訳が改善されることがあります。一方、PDFが正確なレイアウトに依存している場合は、出力を悪化させる可能性もあります。

次の場合には、まずPDFをEPUBに変換してください:

  • PDFがスキャンではなくテキストベースである。
  • コンテンツが主に連続した散文である。
  • 電子書籍リーダーやスマホで読む予定である。
  • 正確な元のページ番号を必要としない。
  • 表、フォーム、カラム、図が最小限である。

次の場合には、最初に変換しないでください:

  • PDFがスキャンされており、OCRが必要である。
  • 文書がマルチカラムの学術レイアウトである。
  • ページ番号、フォーム、スタンプ、署名が重要である。
  • 表、数式、図に正確な配置が必要である。
  • PDFがすでにユーザーが期待する最終レイアウトである。

変換する場合は、Calibreまたはその他の電子書籍変換ワークフローを使用し、翻訳する前にEPUBを点検してください。ファイルが作成されたという理由だけで、変換がうまくいったと仮定しないでください。

10分間のフォーマットテスト

確信が持てない場合は、ドキュメント全体を翻訳する前に、この小さなテストを実行してください。

  1. 代表的な3つのセクション(通常のページ、図や表を含むページ、注釈やリンクを含むページ)をピックアップします。
  2. EPUBとPDFの両方のバージョンがある場合は、両方のフォーマットから同じセクションを翻訳します。
  3. EPUBの出力を電子書籍リーダーまたは電子書籍アプリで開きます。
  4. PDFの出力をPDFビューアで開きます。
  5. 読書順序、見出し、注釈、画像、テキストのオーバーフローを確認します。
  6. 実際の読読端末にとって、クリーンアップの手間が最も少ないフォーマットを選択します。

本の場合、EPUBの結果が通常勝ります。レイアウトがポイントとなる文書の場合、PDFの結果が通常勝ります。

フォーマット固有の障害モード

EPUBの障害モード

  • 弱いツールはテキストを翻訳するが、EPUBパッケージをドロップしてしまう。
  • 目次のアンカーが不正確に書き換えられる。
  • CSSが削除され、章がプレーンテキストのように見えてしまう。
  • 脚注のリンクが行ったり来たりジャンプしなくなる。
  • 固定レイアウトのEPUBセクションが、より長い翻訳に適応しない。
  • 画像の一部であるため、画像内のテキストが翻訳されない。

PDFの障害モード

  • マルチカラムのテキストが間違った順序で読まれる。
  • ヘッダーやフッターが本文に統合されてしまう。
  • 脚注マーカーが間違った文に付けられる。
  • 翻訳後に表の配置が崩れる。
  • 翻訳された長いテキストが固定されたボックスからあふれ出る。
  • スキャンされたページがOCRエラーを引き起こす。
  • ブックマークが翻訳されたドキュメントと一致しない。

これらは異なる問題です。そのため、ツール選びの前に適切なフォーマット選びを行う必要があります。

用途別のEPUB対PDF

用途より優れたソース理由
別の言語で小説を読むEPUBクリーンな段落とリフロー可能な読書
Kindle本の翻訳変換後のEPUBKindleファイルには通常、DRMフリーのEPUBワークフローが必要
学術論文の翻訳PDF引用、図、レイアウトが重要になることが多いため
スキャンされた本の翻訳OCR付きPDF翻訳の前にスキャンを認識する必要があるため
スマホでの読書EPUBリフロー可能なテキストの方が読みやすいため
フォームの保持PDF固定されたフィールドとページのジオメトリが重要なため
教科書の翻訳利用可能な場合はEPUB、レイアウト重視の場合はPDF図、表、数式に依存するため
翻訳版のセルフパブリッシングEPUBまたはソース原稿クリーンで編集可能な出版ワークフローが必要なため

Kindleファイルに関するもう1つのステップ

Kindle本は通常、直接翻訳ツールに渡されることはありません。実用的なワークフローは次のとおりです:

  1. 意図した用途に向けてその本を翻訳する権利があることを確認する。
  2. DRMフリーのファイル、または法的に変換が許可されているファイルのみを扱う。
  3. Calibreを使用してKindleファイルをEPUBに変換する。
  4. 章の構造、目次、画像、注釈についてEPUBを点検する。
  5. EPUBを翻訳する。
  6. 翻訳されたファイルをKindleに戻すか、別のEPUBアプリで読む。

ソースがAZW3、KFX、MOBIなどのKindleフォーマットである場合は、まずDRMフリーのファイルであり、翻訳する権利があることを確認してください。EPUBへの変換は翻訳機能ではなく、個別の準備ステップです。

フォーマットを選んでから翻訳ツールを選ぶ

適切なソースフォーマットが分かったら、ツールを選択してください:

関連記事

EPUB 対 PDF:フォーマット、読書体験、そして翻訳