BookTranslator
BookTranslator

スキャン済みPDFの翻訳:OCRの課題と実践的な解決策

スキャン済みPDFのOCR処理と翻訳方法、よくある認識エラーの診断、ドキュメント対応ワークフローによるレイアウト保持のコツを学びます。

BookTranslator

BookTranslator Team

19 min read

迅速な回答:スキャン済みPDFには翻訳前のOCRが不可欠

スキャンされたPDFを翻訳するには、まずOCRを実行してページ画像をテキスト選択可能な状態にする必要があります。その後、PDF Translatorのようなドキュメント翻訳ツールを使用してOCR処理済みPDFを翻訳します。OCRをスキップすると、多くの翻訳ツールでは元のファイルがそのまま返されたり、ページが抜け落ちたり、すでにテキストレイヤーが含まれている部分のみが翻訳されたりします。

以下のワークフローを使用してください:

  1. PDFを開き、文の選択を試みます。
  2. テキストを選択できない場合は、OCRを実行します。
  3. 翻訳前にOCRテキストを確認します。
  4. OCR処理済みPDFをPDF Translatorにアップロードします。
  5. 翻訳された出力と元のスキャン結果を比較・確認します。

お使いのPDFにすでにテキストレイヤーが存在し、課題がレイアウトの保持である場合は、フォーマットを崩さずにPDFを翻訳するためのガイドをご参照ください。

翻訳ツールでスキャン済みPDFの処理が失敗する理由

スキャンされたPDFは、多くの場合PDFコンテナ内のページ画像の集まりにすぎません。人間には文字として見えても、ファイル自体にはソフトウェアが抽出できる実際のテキストが含まれていないことがあります。

これにより、次のような単純な不具合が発生します:

ファイル形式翻訳ツールが認識するもの発生する現象
テキストベースのPDFテキストおよびレイアウトデータすぐに翻訳を開始できる。
画像のみのスキャン済みPDFページの画像事前にOCRが必要となる。
テキスト・オーバー・イメージPDFスキャン画像に加え、非表示のOCRテキストレイヤー翻訳は可能だが、OCRのエラーが品質に影響を与える。

最も役立つテストは、技術的なものではありません:

  1. PDFを開く。
  2. 個々の単語のハイライトを試みる。
  3. 文章をコピーする。
  4. テキストエディタに貼り付ける。

文章が正しく貼り付けられれば、PDFにはテキストレイヤーが存在します。何も貼り付けられない場合や、ページ全体が1枚の画像として扱われる場合、そのPDFにはOCRが必要です。

OCRは必須のステップである

OCRとは、光学的文字認識(Optical Character Recognition)の略です。画像から文字を読み取り、機械可読なテキストを作成します。PDFの翻訳において、OCRは通常、スキャンされたページの上に不可視のテキストレイヤーを作成します。

そのテキストレイヤーが翻訳のソースとなります。OCRで間違いが生じると、翻訳にもその間違いが引き継がれてしまいます。

よくあるOCRのエラー:

OCRのエラー翻訳上のリスク
rnm として読み取られる単語の意味が変わってしまう。
1l として読み取られる数値、参照、コードなどが誤ったものになる。
O0 として読み取られるID、数式、名前などが破損する恐れがある。
アクセント記号が抜け落ちる名前や専門用語が不正確になる。
段落が結合される文が間違った順序で翻訳される。
表のセルが誤って行ごとに読み取られるデータラベルと値が一致しなくなる。
脚注が本文として扱われる引用や注記が不適切なコンテキストに移動してしまう。
D
これが、OCRの確認ステップが重要である理由です。抽出されたテキストをスポットチェックするまでは、スキャンされたドキュメントを翻訳しないでください。

OCRファーストのワークフロー

ステップ1:PDFの種類を特定する

テキストの選択を試みます。選択ができる場合は、OCRが必要ない可能性があります。選択できない場合は、ファイルが画像のみであるとして扱ってください。

また、ページを視覚的に確認します:

  • ページが傾いている場合は、スキャンであることを示しています。
  • 紙のグレーの質感は、スキャンであることを示しています。
  • 綴じ目付近の影は、撮影された書籍であることを示しています。
  • コントラストが不均一な場合は、コピーであることを示しています。
  • 検索で目に見える単語が見つからない場合は、テキストレイヤーが存在しないことを示しています。

ステップ2:可能であればスキャン品質を向上させる

OCRの品質は、画像の品質から始まります。再スキャンが可能な場合は、OCRエラーの修正に時間を費やす前に実行してください。

次の画像品質チェックリストを使用してください:

  • 小さな文字が読める十分な高解像度でスキャンする。
  • ページを平らに真っ直ぐ保つ。
  • 綴じ目付近の影を避ける。
  • 表の端、指、背景の不要なものをトリミングする。
  • テキストとページのコントラストを強くする。
  • 行全体が見えるようにする。
  • 正しいページの向きを使用する。
  • 文字がぼやけるほど画像を強く圧縮しない。

古い書籍やコピーの場合、最大の効果をもたらすのは通常、歪みの補正、コントラストの調整、およびピントが合っていないページの再スキャンです。

ステップ3:OCRを実行する

ブランドではなく、ドキュメントに適したOCRツールを選択してください。

OCRの選択肢最適な用途注意点
Adobe Acrobat OCR一般的なビジネス用のスキャンおよびPDFのクリーンアップ利用前に現在のプランのアクセス権を確認する。
ABBYY FineReader複雑なスキャン、表、列、および困難なレイアウト引き続き手動による確認が必要。
TesseractまたはOCRmyPDFローカル、技術的、および反復可能なOCRワークフローコマンドラインツールに慣れている必要がある。
オンラインOCRツールリスクの低い単発のファイルプライバシー、ファイル制限、品質が変動する。
スマホのスキャンアプリ新しいスキャンを素早くキャプチャする遠近感の歪みがOCRに悪影響を与えることがある。

機密性の高い契約書、医療記録、財務書類、未発表の原稿、または査読中の学術論文の場合は、ローカルでのOCRワークフローまたは信頼できる環境を優先してください。機密性の高いスキャンを不特定の無料OCRサイトにアップロードしないでください。

ステップ4:OCRテキストを確認する

翻訳後ではなく、翻訳前に確認を行います。難しいページからいくつかテキストをコピーし、それが読み取り可能かチェックしてください。

検査するサンプルのページ:

  • 表紙。
  • 情報の詰まった本文のページ。
  • 表のあるページ。
  • 脚注のあるページ。
  • 小さな文字のあるページ。
  • スタンプ、手書き文字、または余白のメモがあるページ。
  • ドキュメントが多言語の場合は、各言語のページ。

確認すべきポイント:

  • 欠落している段落。
  • 結合された列。
  • 途切れた単語。
  • 誤った文字。
  • 失われたダイアクリティカルマーク(分音符)。
  • 値から切り離された表のラベル。
  • 本文に挿入されてしまった見出し。
  • 文の中に混入したページ番号。

OCRの品質が低い場合は、翻訳の前に修正してください。翻訳ツールは、OCRが捉えられなかった意味を確実に復元することはできません。

ステップ5:OCR処理済みPDFを翻訳する

PDFにクリーンなテキストレイヤーが備わったら、PDF Translatorにアップロードします。これで、翻訳ステップをページ画像ではなくテキストに対して実行できるようになります。

翻訳後、以下を比較します:

  • 元のスキャン
  • OCRテキストレイヤー
  • 翻訳済みPDF

この3者間の確認により、エラーの原因がOCRにあるのか翻訳にあるのかを特定しやすくなります。OCRのテキストが間違っている場合はOCRを再実行し、OCRのテキストは正しいが翻訳が間違っている場合は翻訳を修正します。

ステップ6:高リスクなコンテンツを確認する

スキャンされたドキュメントには、古い契約書、政府の書式、学術論文、マニュアル、歴史的文書、書籍のページなど、まさに慎重な確認が必要なコンテンツが含まれていることがよくあります。

以下の項目を手動で確認してください:

  • 名前
  • 日付
  • 数値
  • 住所
  • 製品コード
  • 法的参照
  • 引用
  • 表のラベル
  • 単位
  • 数式
  • キャプション
  • 脚注

研究や学術ファイルに関しては、学術研究論文の翻訳に関するガイドもお読みください。スキャンされた学術PDFには、OCRのリスクに加えて引用やレイアウトのリスクが加わるためです。

サイドバイサイドの失敗例

OCR出力を確認する際は、この表を使用してください。

元のスキャンが示している可能性が高いもの不質なOCR出力なぜそれが重要なのか
modernmodem意味が完全に変わってしまう。
Section 10Section IO法律上または技術上の参照が破損する恐れがある。
20262O26日付やIDの信頼性が失われる。
patientpatlent医療用語や技術用語が不正確になる。
2つの独立した列1つの結合された段落翻訳ツールが文を間違った順序で読んでしまう。
ラベルと値を含む表の行混ざり合ったテキストの単一の行データが正しいラベルに対応しなくなる。
脚注マーカー 1文字 l注記が間違った文に付いてしまう恐れがある。

OCRレイヤーにこれらのエラーが見つかった場合は、翻訳の前にOCRを修正してください。

どのツールを使用すべきか?

ドキュメントの難易度に応じて選択してください。

ドキュメント推奨されるパス
クリーンなビジネス向けスキャンAcrobatやその他の信頼できるOCRツールでOCRを実行した後、PDF Translatorを使用する。
古い書籍のスキャン歪みを補正してコントラストを改善し、慎重にOCRを実行してから翻訳する。
学術論文のスキャンOCRを実行し、数式・引用・表を確認してから、レイアウトを確認しながら翻訳する。
手書きのメモ翻訳の前に手動による文字起こしが必要になる場合がある。
シンプルな個人的文書プライバシーのリスクが低い場合は、オンラインOCRでも許容される場合がある。
機密文書ローカルでのOCRまたは信頼できる管理されたワークフローを使用する。

より幅広いツールの比較については、最適なPDF翻訳ツールのガイドをご覧ください。

よくあるスキャン済みPDFの課題

低解像度のページ

低解像度のスキャンでは文字が互いにじんでしまいます。OCRが rnmcld、あるいは句読点とホコリを混同する恐れがあります。

修正方法:可能であれば再スキャンします。それができない場合は、コントラストを上げて再度OCRを試みます。

歪んだページや湾曲したページ

書籍のスキャンでは綴じ目の近くが湾曲することがよくあります。OCRは湾曲した行の読み取りが苦手であり、テキストの順序を並べ替えてしまうことがあります。

修正方法:ページを平らにして再スキャンするか、歪み補正(デスクewおよびdewarping)機能付きのOCRツールを使用します。

マルチカラム(複数段組)レイアウト

OCRは左右の列を1つの文のストリームに結合してしまうことがあります。

修正方法:翻訳の前に読み順を確認します。学術論文では特にこの点に注意が必要です。

OCRがテキストと構造の両方を検出する必要があるため、表の処理は困難です。テキストレイヤーが間違っている一方で、表の見た目は正しく見えることがあります。

修正方法:表からOCRテキストをコピーし、ラベルが依然として値と一致していることを確認します。

手書き文字と署名

印刷されたテキストのOCRは、手書き文字認識よりもはるかに信頼性が高くなります。手書きの余白のメモ、署名、記入済みのフォームなどは、見落とされたり文字化けしたりする可能性があります。

修正方法:翻訳の前に、重要な手書き文字を手動で書き起こします。

混合言語

OCRは、ソース言語を認識している場合に最も効果を発揮します。英語、フランス語、中国語が混在するスキャンでは、OCRが1つの言語のみに設定されていると失敗する可能性があります。

修正方法:ツールがサポートしている場合は関連するすべてのOCR言語を選択し、言語セクションごとにスポットチェックを行います。

プライバシーとセキュリティのチェックリスト

スキャンされたPDFをどこかにアップロードする前に、以下を自問してください:

  • ドキュメントに個人データが含まれているか?
  • 医療、法律、財務、学術、または未発表の資料が含まれているか?
  • クライアントとの契約や学校のポリシーの対象となっているか?
  • このドキュメントに対してオンラインOCRサービスの利用が許可されているか?
  • 代わりにローカルでのワークフローが必要か?
  • 翻訳が不要なページを削除できるか?

スキャンされたPDFは、契約書、ID、フォーム、研究ドラフト、社内アーカイブから作成されるため、機密性が高いことがよくあります。OCRのアップロードに関する決定は、元のドキュメントを扱う場合と同じように慎重に行ってください。

関連記事