BookTranslator
BookTranslator

스캔된 PDF 번역하기: OCR 문제와 실용적인 해결책

스캔된 PDF를 OCR 처리하고 번역하는 방법, 일반적인 인식 오류 진단 방법, 그리고 문서 인식 워크플로를 통해 레이아웃을 보존하는 방법을 알아보세요.

BookTranslator

BookTranslator Team

19 min read

빠른 답변: 스캔된 PDF는 번역 전에 OCR이 필요합니다

스캔된 PDF를 번역하려면 먼저 OCR을 실행하여 페이지 이미지를 텍스트로 선택할 수 있도록 변환해야 합니다. 그런 다음 PDF Translator와 같은 문서 번역기를 사용하여 OCR이 처리된 PDF를 번역하세요. OCR을 생략하면 많은 번역 도구가 원본 파일을 그대로 반환하거나, 페이지를 누락하거나, 이미 텍스트 레이어가 포함된 부분페이지만 번역하게 됩니다.

다음 워크플로를 사용하세요:

  1. PDF를 열고 문장을 선택해 봅니다.
  2. 텍스트를 선택할 수 없는 경우, OCR을 실행합니다.
  3. 번역하기 전에 OCR 텍스트를 검토합니다.
  4. OCR이 처리된 PDF를 PDF Translator에 업로드합니다.
  5. 원본 스캔본과 번역된 결과물을 비교하여 검토합니다.

PDF에 이미 선택 가능한 텍스트가 있고 서식 보존이 문제인 경우, 서식을 잃지 않고 PDF 번역하기 가이드를 참조하세요.

번역 도구에서 스캔된 PDF가 실패하는 이유

스캔된 PDF는 종종 PDF 컨테이너 내부에 있는 일련의 페이지 이미지일 뿐입니다. 사람의 눈에는 단어가 보이지만, 소프트웨어가 추출할 수 있는 실제 텍스트가 파일에 포함되어 있지 않을 수 있습니다.

이로 인해 다음과 같은 단순한 문제가 발생합니다:

파일 유형번역기가 인식하는 내용발생하는 현상
텍스트 기반 PDF텍스트 및 레이아웃 데이터즉시 번역을 시작할 수 있습니다.
이미지 전용 스캔 PDF페이지의 사진먼저 OCR이 필요합니다.
텍스트 오버레이 이미지 PDF스캔 이미지와 숨겨진 OCR 텍스트 레이어번역이 작동할 수 있지만, OCR 오류가 품질에 영향을 줍니다.

가장 유용한 테스트는 기술적인 것이 아닙니다:

  1. PDF를 엽니다.
  2. 개별 단어를 강조 표시해 봅니다.
  3. 문장을 복사합니다.
  4. 텍스트 편집기에 붙여넣습니다.

문장이 올바르게 붙여넣어지면 PDF에 텍스트 레이어가 있는 것입니다. 아무것도 붙여넣어지지 않거나 전체 페이지가 하나의 이미지처럼 작동하는 경우 PDF에 OCR이 필요합니다.

OCR은 선택사항이 아닙니다

OCR은 광학 문자 판독(Optical Character Recognition)을 의미합니다. 이미지에서 텍스트를 읽어내어 기계가 읽을 수 있는 텍스트를 만듭니다. PDF 번역의 경우 OCR은 일반적으로 스캔된 페이지 위에 보이지 않는 텍스트 레이어를 만듭니다.

해당 텍스트 레이어가 번역의 소스가 됩니다. OCR에 실수가 발생하면 번역에도 그 실수가 그대로 이어집니다.

일반적인 OCR 실수:

OCR 실수번역 위험성
rnm으로 인식됨단어의 의미가 바뀝니다.
1l로 인식됨숫자, 참조 또는 코드가 잘못됩니다.
O0으로 인식됨ID, 공식, 이름이 깨질 수 있습니다.
악센트 누락이름과 용어가 부정확해집니다.
열이 병합됨문장이 잘못된 순서로 번역됩니다.
표 셀이 행 단위로 잘못 읽힘데이터 레이블이 값과 일치하지 않게 됩니다.
각주가 본문 텍스트로 처리됨인용구와 주석이 잘못된 컨텍스트로 이동합니다.

이것이 바로 OCR 검토 단계가 중요한 이유입니다. 추출된 텍스트를 샘플 검사하기 전에는 스캔된 문서를 번역하지 마세요.

OCR 우선 워크플로

1단계: PDF 유형 식별하기

텍스트를 선택해 보세요. 선택이 작동하면 OCR이 필요하지 않을 수 있습니다. 선택에 실패하면 파일을 이미지 전용으로 취급하세요.

페이지를 시각적으로 검사할 수도 있습니다:

  • 기울어진 페이지는 스캔본임을 나타냅니다.
  • 회색 종이 텍스처는 스캔본임을 나타냅니다.
  • 제본 부근의 그림자는 촬영된 책임을 나타냅니다.
  • 고르지 않은 명암은 복사본임을 나타냅니다.
  • 눈에 보이는 단어가 검색되지 않는 것은 텍스트 레이어가 없음을 나타냅니다.

2단계: 가능한 경우 스캔 품질 개선하기

OCR 품질은 이미지 품질에서 시작됩니다. 다시 스캔할 수 있다면 OCR 오류를 수정하는 데 시간을 쓰기 전에 먼저 스캔하세요.

다음 이미지 품질 체크리스트를 사용하세요:

  • 작은 텍스트를 읽을 수 있을 만큼 충분히 높은 해상도로 스캔하세요.
  • 페이지를 평평하고 곧게 유지하세요.
  • 제본 부근의 그림자를 피하세요.
  • 표 가장자리, 손가락 또는 배경 잡티를 자르세요.
  • 텍스트와 페이지 사이에 강한 대비를 사용하세요.
  • 전체 줄이 보이도록 하세요.
  • 올바른 페이지 방향을 사용하세요.
  • 글자가 흐려질 정도로 이미지를 심하게 압축하지 마세요.

고서와 복사본의 경우, 가장 큰 효과는 일반적으로 기울기 보정, 명암 대비 수정, 초점이 맞지 않는 페이지 재스캔에서 나옵니다.

3단계: OCR 실행하기

브랜드가 아닌 문서에 따라 OCR 도구를 선택하세요.

OCR 옵션가장 적합한 용도주의해야 할 점
Adobe Acrobat OCR일반 업무용 스캔 및 PDF 정리의존하기 전에 현재 플랜 액세스 권한을 확인하세요.
ABBYY FineReader복잡한 스캔, 표, 열 및 어려운 레이아웃여전히 수동 검토가 필요합니다.
Tesseract 또는 OCRmyPDF로컬, 기술적, 반복 가능한 OCR 워크플로명령줄 도구에 대한 익숙함이 필요합니다.
온라인 OCR 도구위험도가 낮은 일회성 파일개인정보 보호, 파일 제한, 품질이 다양합니다.
휴대폰 스캐닝 앱새로운 스캔본을 빠르게 캡처원근 왜곡이 OCR에 악영향을 줄 수 있습니다.

비밀 계약서, 의료 기록, 재무 문서, 미출판 원고, 심사 중인 학술 작업의 경우 로컬 OCR 워크플로 또는 신뢰할 수 있는 환경을 선호하세요. 민감한 스캔본을 무작위 무료 OCR 사이트에 업로드하지 마세요.

4단계: OCR 텍스트 검토하기

번역 후가 아니라 번역 전에 검토하세요. 여러 어려운 페이지에서 텍스트를 복사하여 읽을 수 있는지 확인하세요.

검사할 샘플 페이지:

  • 표지.
  • 밀도가 높은 본문 페이지.
  • 표 페이지.
  • 각주가 있는 페이지.
  • 작은 텍스트가 있는 페이지.
  • 스탬프, 손글씨 또는 여백 메모가 있는 페이지.
  • 문서가 다국어인 경우 각 언어별 페이지.

확인할 사항:

  • 누락된 단락.
  • 병합된 열.
  • 깨진 단어.
  • 잘못된 문자.
  • 손실된 발음 구별 부호.
  • 값과 분리된 표 레이블.
  • 본문 텍스트에 삽입된 머리글.
  • 문장에 섞인 페이지 번호.

OCR 품질이 좋지 않은 경우 번역 전에 수정하세요. 번역기는 OCR이 캡처하지 못한 의미를 안정적으로 복구할 수 없습니다.

5단계: OCR 처리된 PDF 번역하기

PDF에 깨끗한 텍스트 레이어가 생기면 PDF Translator에 업로드하세요. 이제 번역 단계에서 페이지 이미지 대신 텍스트로 작업할 수 있습니다.

번역 후 다음을 비교하세요:

  • 원본 스캔
  • OCR 텍스트 레이어
  • 번역된 PDF

이 3단계 검토를 통해 오류가 OCR에서 발생했는지 번역에서 발생했는지 확인할 수 있습니다. OCR 텍스트가 잘못된 경우 OCR을 다시 실행하세요. OCR 텍스트는 맞는데 번역이 잘못된 경우 번역을 수정하세요.

6단계: 고위험 콘텐츠 검토하기

스캔된 문서에는 종종 세심한 검토가 필요한 콘텐츠가 정확히 포함되어 있습니다: 오래된 계약서, 정부 서식, 학술 논문, 매뉴얼, 역사적 문서, 책 페이지 등.

다음 항목을 수동으로 검토하세요:

  • 이름
  • 날짜
  • 숫자
  • 주소
  • 제품 코드
  • 법적 참조
  • 인용구
  • 표 레이블
  • 단위
  • 공식
  • 캡션
  • 각주

연구 및 학술 파일의 경우, 스캔된 학술 PDF에는 OCR 위험 외에도 인용 및 레이아웃 위험이 추가되므로 학술 연구 논문 번역하기 가이드도 함께 읽어보세요.

나란히 보는 실패 예시

OCR 출력 결과물을 검토하는 동안 이 표를 활용하세요.

원본 스캔본의 예상 내용잘못된 OCR 출력중요한 이유
modernmodem의미가 완전히 바뀝니다.
Section 10Section IO법적 또는 기술적 참조가 깨질 수 있습니다.
20262O26날짜와 ID가 신뢰할 수 없게 됩니다.
patientpatlent의료 또는 기술 용어가 잘못됩니다.
두 개의 분리된 열하나의 병합된 단락번역이 문장을 잘못된 순서로 읽습니다.
레이블과 값이 있는 표 행혼합된 텍스트의 단일 라인데이터가 올바른 레이블에 매핑되지 않습니다.
각주 마커 1문자 l주석이 잘못된 문장에 첨부될 수 있습니다.

OCR 레이어에서 이러한 오류가 발견되면 번역하기 전에 OCR을 수정하세요.

어떤 도구를 사용해야 할까요?

문서의 난이도에 따라 선택하세요.

문서권장 경로
깨끗한 비즈니스 스캔Acrobat 또는 기타 신뢰할 수 있는 OCR 도구에서 OCR을 수행한 후 PDF Translator를 사용합니다.
고서 스캔기울기를 보정하고 명암을 개선한 후 꼼꼼하게 OCR을 수행하고 번역합니다.
학술 논문 스캔OCR을 수행하고, 공식/인용구/표를 검토한 후 레이아웃 검토와 함께 번역합니다.
손글씨 메모번역하기 전에 수동 전산화(필사)가 필요할 수 있습니다.
단순한 개인 문서개인정보 보호 위험이 낮다면 온라인 OCR을 사용할 수 있습니다.
민감한 문서로컬 OCR 또는 신뢰할 수 있는 제어된 워크플로를 사용하세요.

더 광범위한 도구 비교를 원하시면 최고의 PDF 번역기 가이드를 참조하세요.

일반적인 스캔된 PDF 문제

저해상도 페이지

저해상도 스캔은 글자들을 서로 뭉개지게 만듭니다. OCR이 rnm, cld, 또는 구두점과 먼지를 혼동할 수 있습니다.

해결책: 가능하면 다시 스캔하세요. 그럴 수 없다면 명암 대비를 높이고 OCR을 다시 시도하세요.

기울어지거나 휘어진 페이지

책 스캔은 종종 제본 부근이 휘어집니다. OCR이 휘어진 줄을 제대로 읽지 못해 텍스트 순서가 뒤바뀔 수 있습니다.

해결책: 페이지를 평평하게 펴고 다시 스캔하거나, 기울기 보정 및 왜곡 보정 기능이 있는 OCR 도구를 사용하세요.

다단 레이아웃

OCR은 왼쪽 열과 오른쪽 열을 하나의 문장 스트림으로 병합할 수 있습니다.

해결책: 번역 전에 읽기 순서를 검사하세요. 학술 논문은 이 부분에 특별한 주의가 필요합니다.

표는 OCR이 텍스트와 구조를 모두 감지해야 하므로 어렵습니다. 시각적으로는 표가 올바르게 보여도 텍스트 레이어는 잘못되어 있을 수 있습니다.

해결책: 표에서 OCR 텍스트를 복사하여 레이블이 여전히 값과 일치하는지 확인하세요.

손글씨 및 서명

인쇄체 OCR은 필기체 인식보다 훨씬 신뢰성이 높습니다. 손글씨 여백 메모, 서명, 작성된 서식은 누락되거나 깨질 수 있습니다.

해결책: 번역 전에 필수적인 손글씨를 수동으로 전사하세요.

혼합 언어

OCR은 소스 언어를 알고 있을 때 가장 잘 작동합니다. 영어, 프랑스어, 중국어가 포함된 스캔본은 OCR이 단일 언어로만 설정된 경우 실패할 수 있습니다.

해결책: 도구가 지원하는 경우 관련 OCR 언어를 모두 선택한 다음 각 언어 섹션을 샘플 검사하세요.

개인정보 보호 및 보안 체크리스트

스캔된 PDF를 어디에든 업로드하기 전에 다음을 자문해 보세요:

  • 문서에 개인 데이터가 포함되어 있습니까?
  • 의료, 법률, 재무, 학술 또는 미출판 자료가 포함되어 있습니까?
  • 고객 계약이나 학교 정책의 적용을 받습니까?
  • 이 문서에 온라인 OCR 서비스가 허용됩니까?
  • 대신 로컬 워크플로가 필요합니까?
  • 번역이 필요 없는 페이지를 제거할 수 있습니까?

스캔된 PDF는 계약서, ID, 양식, 연구 초안, 내부 아카이브에서 비롯되기 때문에 민감한 경우가 많습니다. OCR 업로드 결정을 원본 문서를 다루는 것과 같은 방식으로 다루세요.

관련 글