PDF 복사-붙여넣기 시 텍스트가 잘못 복사되나요? 텍스트 레이트 먼저 진단하기
PDF가 올바르게 보이지만 잘못된 단어나 숫자가 복사될 수 있습니다. 4개의 샘플 파일을 사용하여 텍스트 레이어 문제를 파악하고 검증 가능한 수정 방법을 선택하세요.

PDF가 올바르게 보이지만 잘못된 텍스트가 붙여넣어지는 경우, 붙여넣은 버전을 소스로 사용하는 것을 중단하세요. 먼저 짧은 구문(이름, 문장, 숫자)을 보이는 페이지와 비교해 보세요. 다음 단계는 파일에 추출 가능한 텍스트가 없는지, 잘못된 문자 매핑이 있는지, 부정확한 숨겨진 OCR 레이어가 있는지, 읽기 순서에 문제가 있는지에 따라 달라집니다. 전체 문서에 대해 OCR을 실행하는 것이 네 가지 모두에 대한 올바른 첫 번째 조치는 아닙니다.
가장 위험한 오류는 외계어가 아닙니다. 그럴듯한 텍스트입니다. 예를 들어 페이지에는 18 notebooks 라고 표시되는데 추출된 텍스트는 13 notebooks라고 표시되는 식입니다. 당사자의 개인 문서유출 없이 이러한 차이를 눈으로 확인할 수 있도록 네 개의 다운로드 가능한 PDF를 만들었습니다.
간단한 복사 및 비교 확인부터 시작하세요
원본 파일은 변경하지 않은 채로 두고 작업용 복사본을 엽니다. 짧은 선택 영역 하나를 일반 텍스트 편집기에 붙여넣은 다음, 페이지와 한 글자씩 비교합니다. 다른 페이지와, 가능하다면 두 번째 PDF 리더에서도 반복합니다. 이는 진단 확인을 위한 것이며 나머지 문서가 올바르다는 증거는 아닙니다.
| 현상 | 조사할 내용 | 유용한 첫 번째 조치 |
|---|---|---|
| 선택되지 않거나 붙여넣기가 비어 있음 | 페이지에 이미지1만 포함되어 있을 수 있음 | 리더가 텍스트가 아닌 페이지 이미지를 선택하고 있는지 확인 |
| 페이지에서는 정상적으로 보이지만 문자가 일관되게 변경됨 | 문자 인코딩 또는 추출 매핑 | 다른 리더의 출력 결과 비교; 원본 소스 파일 또는 더 나은 내보내기 결과물 확인 |
| 대부분의 단어는 읽을 수 있지만 이름이나 숫자가 잘못됨 | 이전 OCR을 포함하여 부정확한 텍스트 레이어 | 추출된 구문을 보이는 스캔본과 비교 |
| 문자는 맞지만 열, 캡션 또는 각주가 잘못된 순서로 나타남 | 레이아웃 및 읽기 순서 추출 | 단일 열이나 단락을 따로따로 테스트하세요 |
| 복사가 비활성화됨 | 문서 권한 또는 리더 동작 | 파일의 권한을 확인하고 원본 소스에 사용 가능한 복사본을 요청하세요 |
이는 단 하나의 증상으로 모든 PDF의 내부 구조를 파악하는 방법이 아니라 단서일 뿐입니다. Adobe의 콘텐츠 재사용 지침 은(는) 이미지 전용 콘텐츠와 복사 제한을 구분합니다. 둘 다 손상된 텍스트 레이어로 자동으로 간주해서는 안 됩니다. pypdf 추출 가이드 는 이미지, 텍스트 추출, 그리고 표 및 간격 처리 시의 어려움에 대해 각각 설명합니다.
긴 책이나 보고서의 경우 각 문제가 발생하는 PDF 페이지 번호를 기록해 두세요. 깨끗한 표지 하나만으로는 부록, 스캔된 삽입물, 또는 2단으로 된 장이 제대로 복사되는지 알 수 없습니다.
4가지 PDF: 페이지에 보이는 것과 추출 결과의 차이
테스트 페이지에는 다음을 포함하여 4개의 원본 줄이 포함되어 있습니다.
아카이브에는 18개의 노트북이 포함되어 있습니다.
항목 B-204가 5월 6일에 도착했습니다.
우리는 일반 디지털 PDF를 하나 만들고 고의로 세 가지 대안을 구성했습니다. 그런 다음 Poppler와 pypdf를 사용하여 텍스트를 추출했습니다. 두 추출기 모두 이 테스트의 각 파일에 대해 동일한 텍스트를 반환했습니다.
| PDF 다운로드 | 구성 방법 | 실제 추출된 결과 |
|---|---|---|
| 올바른 디지털 텍스트 | 임베디드 글꼴이 포함된 일반 가시적 텍스트 | 18 notebooks; B-204; 6 May |
| 잘못된 유니코드 매핑 | 가시적 글꼴을 변경하지 않고 추출 매핑을 변경함 | 13 notebooks; 여러 소문자 a 문자가 다음으로 변경됨 x |
| 잘못된 숨겨진 텍스트 | 페이지 이미지 위에 의도적으로 잘못된 보이지 않는 텍스트를 배치함 | 13 notebooks; B-2O4; 8 May |
| 이미지 전용 페이지 | 텍스트 레이트가 없는 동일한 페이지 이미지를 사용함 | 빈 텍스트 출력 |
정상적으로 보이는 디지털 페이지도 복사가 잘못될 수 있음
비교에서 처음 두 PDF는 동일한 픽셀로 렌더링되었지만 추출된 텍스트는 달랐습니다. 두 번째 파일에서는 의도적으로 변경했습니다. ToUnicode 매핑: 저장된 문자 코드를 유니코드 텍스트로 매핑하는 데 사용되는 정보입니다. 보이는 숫자는 그대로 유지된 반면, 8, 추출 결과는 3반환되었습니다. pypdf CMap 문서 는 이 매핑 메커니즘을 보여줍니다.
이는 모든 깨진 PDF에 동일한 결함이 있다는 주장이 아니라 하나의 실패 메커니즘을 보여줍니다. 누락된 ToUnicode 항목 하나만으로는 진단이 되지 않으며, 매핑을 수동으로 편집하는 것은 일반 독자용 수리가 아닙니다.
검색 가능한 스캔본에도 잘못된 단어가 포함될 수 있습니다
세 번째와 네 번째 PDF 역시 서로 동일하게 렌더링되었습니다. 하나에는 잘못된 숨겨진 텍스트가 포함되어 있었고, 다른 하나에는 아무것도 없었습니다. 세 번째 파일에서는 추출 과정에서 수량과 날짜가 모두 조용히 변경되었습니다. 코드 B-2O4 에는 이미지에 표시된 숫자가 아닌 O가 아니라 0 문자가 포함되어 있었습니다.
우리는 숨겨진 텍스트 레이트가 포함할 수 있는 불일치 유형을 나타내기 위해 이러한 오류를 직접 삽입했습니다. OCR 엔진은 이를 생성하지 않았습니다 . 네 번째 파일은 그 반대의 상황, 즉 읽을 수 있는 페이지 이미지이지만 이러한 텍스트 추출기가 반환할 내용이 없는 상태를 보여줍니다. 이는 기존 PDF 텍스트를 추출하며 이미지 내부의 단어를 인식하지 못한다는 pypdf의 문서화된 제한 사항과 일치합니다.
이 테스트가 규명하는 것과 규명하지 않는 것
2026년 9월 10일, Poppler 26.08.0 및 pypdf 6.10.0을 사용하여 1페이지 분량의 파일 4개를 점검했습니다. 시각적 비교에는 144 dpi의 Poppler를 사용했습니다. 픽셀 일치 여부는 두 쌍 내에서만 유지되었으며, 4개 파일 전체에 걸쳐 일치하지는 않았습니다. 이미지 기반 쌍은 추가 렌더링 단계를 거쳤기 때문입니다.
이는 통제된 시연이며 OCR 정확도 벤치마크가 아닙니다. 다국어 인식, 복잡한 레이아웃, Acrobat 복구, OCRmyPDF 복구 또는 BookTranslator 업로드를 테스트하지 않습니다. 이는 블라인드 테스트가 아니라 알려진 결함이 있는 인위적인 예시입니다.
해당 원본 텍스트 및 픽셀 결과, , 재현 지침, 그리고 생성기 는 파일과 함께 제공됩니다. 이들은 오픈 폰트 라이선스가 포함된 수정되지 않은 Noto Sans 글꼴을 사용합니다.
가장 지장이 적은 다음 단계를 선택하세요
다음 복구 경로는 공식 문서와 실제 진단을 바탕으로 합니다. 이들은 앞서 진행한 4개 파일 실험의 복구 결과가 아닙니다. 중요한 데이터를 교체하기 전에 반드시 복사본으로 작업하고 결과를 확인하세요.
원본 문서가 있다면 먼저 새로 내보내기를 시도해 보세요
원래의 워드 프로세싱, 출판 또는 조판 파일에서 새로 만든 PDF가 유용한 첫 번째 후보입니다. 문제가 발생한 구절을 정확히 비교해 보세요. 파일 이름이 바뀌었거나 내보내기에 성공했다고 해서 텍스트가 올바르게 수정되었다고 가정해서는 안 됩니다.
아카이브나 출판사에서 얻은 자료의 경우, 텍스트가 포함된 다른 버전이 있는지 확인하세요. 판본과 페이지 참조가 일치해야 합니다. 다른 판본의 더 깨끗한 파일에는 필요한 구절이 그대로 유지되지 않을 수 있습니다.
스캔본에 몇 가지 인식 오류가 있는 경우 해당 단어를 검토하세요
Acrobat은 다음 경로의 워크플로를 제공합니다: 스캔 및 OCR → 인식된 텍스트 교정. 이를 통해 의심되는 단어로 표시된 부분을 스캔된 이미지와 대조하여 검토하고 인식된 텍스트를 수정할 수 있습니다. 다음의 Adobe's current correction instructions 을 사용 중인 버전의 인터페이스에 맞춰 따르세요.
의심되는 단어 목록이 비어 있다고 해서 완벽하다고 판단하지 마세요. 인용하거나 번역할 이름, 날짜, 식별자 및 수량은 별도로 직접 비교해야 합니다. 저희가 의도적으로 틀리게 만든 13 notebooks 예시는 읽기 쉬운 출력만으로는 충분하지 않은 이유를 보여줍니다.
숨겨진 텍스트가 전반적으로 잘못된 경우 redo와 force를 구분하세요
명령줄 도구를 사용하는 독자를 위해 OCRmyPDF는 이미 텍스트가 포함된 페이지에 대한 다양한 처리 방식을 설명합니다:
--redo-ocr은(는) 기존의 인쇄되지 않는 OCR 텍스트를 제거하고, 인쇄 가능한 텍스트는 OCR에서 제외한 채 다시 인식합니다.--skip-text은(는) 텍스트가 포함된 페이지를 건너뜁니다. 이는 기존의 잘못된 텍스트 레이어를 수리하는 방법이 아닙니다.--force-ocr은(는) 페이지 콘텐츠를 래스터화하고 결과 이미지에 대해 OCR을 실행합니다.
이러한 동작에 대한 설명은 OCRmyPDF의 기존 텍스트 오류 문서에서 확인하실 수 있습니다. 버전 17에서는 동일한 선택 항목을 --mode을(를) 통해서도 사용할 수 있으며, 이전 플래그들은 계속 별칭으로 유지됩니다.
비용과 예외 상황이 존재합니다. Redo는 모든 과거 OCR 구성을 식별할 수 없으며, 일부 파일은 기술적으로 인쇄 가능한 텍스트 위에 불투명한 이미지를 배치합니다. Force는 인쇄 가능한 텍스트와 벡터 콘텐츠를 픽셀로 변환하고 대화형 콘텐츠를 평면화합니다. 또한 Redo와 force는 기존 구조 트리를 재구성하는 대신 폐기합니다. 다음을 검토하세요: OCRmyPDF의 고급 문서 를 참고하여 둘 중 하나를 선택하세요.
따라서 복원된 추출물이 곧 접근성 검사를 통과한다는 의미는 아닙니다. 문서에 제목, 읽기 순서 또는 접근 가능한 그림이 필요한 경우 별도의 번역된 PDF 접근성 검사.
페이지나 언어가 다른 경우 하나의 설정이 모든 곳에 적합하다고 가정하지 마세요
어떤 페이지에 신뢰할 수 있는 디지털 텍스트가 이미 포함되어 있고 어떤 페이지에 인식이 필요한지 나열하세요. OCR을 구성하기 전에 해당 페이지의 언어를 확인하세요. 저희의 혼합 언어 PDF OCR 가이드 는 언어 선택을 다루며, 이는 기존 텍스트 레이어가 잘못되었는지 여부를 판단하는 것과는 다른 문제입니다.
텍스트 레이어가 전혀 없는 경우 다음으로 이동하세요: 스캔된 PDF 워크플로. 다른 일반 텍스트 추출기를 반복해서 시도해도 pypdf가 이미지 안의 단어를 인식하지는 못합니다.
교체 텍스트를 사용하기 전에 확인하세요
다음 기능을 사용하세요: 다운로드 가능한 텍스트 레이어 점검 시트 를 통해 시각적 참고 자료, 이전 추출 결과, 대체 추출 결과를 나란히 비교할 수 있습니다. 알려진 오류에서 시작한 다음, 다른 구절과 독특한 페이지 레이아웃을 테스트하세요.
- 단어: 이름과 생소한 용어를 한 글자씩 비교하세요.
- 숫자: 수량, 소수점, 날짜 및 식별자를 확인하세요.
B-204. - 순서: 줄 바꿈을 넘어 전체 단락을 읽고, 열과 인근 캡션을 별도로 확인하세요.
- 범위: 필요한 페이지와 구절이 누락되지 않았는지 확인하세요.
- 파일 동작: 저장된 대체 파일을 다시 열고 복사 테스트를 반복하세요. 북마크, 링크 또는 접근 가능한 구조에 의존하는 경우 해당 항목도 확인하세요.
선택한 구절을 통과시키는 것은 해당 구절에 대한 증거를 제공할 뿐이며, 파일 전체를 보증하는 것은 아닙니다. 특히 인용구나 생소한 언어를 교정할 때는 원본 페이지 이미지를 참고 자료로 보존하세요.
출처를 신뢰할 수 있게 된 후에 번역하세요
목적이 단락 인용이나 필기였다면 검증된 추출물만으로도 충분할 수 있습니다. 해당 작업을 해결하는 데 번역 서비스가 필요하지는 않습니다.
문서 전체를 다른 언어로 읽어야 하는 경우, 검증된 파일을 시작점으로 삼아 PDF 번역을 진행하세요. BookTranslator의 OCR 모드는 인식된 콘텐츠를 기반으로 번역된 PDF를 다시 빌드하며, 기존 텍스트 레이어를 복구하거나 원본 페이지 레이아웃을 정확히 재현하겠다는 약속은 아닙니다.
번역 단계 내내 참고 페이지를 유지하세요. 여기서 확인한 것과 동일한 수량 및 식별자는 최종 PDF 번역 품질 검수(QA) 단계에 포함됩니다. 유창한 번역만으로는 원문이 18 가 아닌 13.





