PDF 글자 복사가 안 될 때 해결 방법|스캔 PDF OCR 직접 테스트

PDF 글자 복사 안됨 문제와 OCR 적용 전후를 설명하는 대표 이미지

PDF 글자 복사 안됨 문제는 문자가 실제 텍스트가 아니라 스캔한 이미지로 저장되어 있을 때 발생할 수 있습니다. 특히 PDF에서 마우스로 글자를 드래그해도 선택되지 않는다면 이미지형 PDF인지 먼저 확인해 볼 필요가 있습니다.

이 경우 OCR(이미지 속 문자를 인식해 텍스트로 변환하는 기술)을 사용하면 글자를 선택하거나 복사할 수 있는 PDF로 만들 수 있습니다.

이번 글에서는 직접 테스트용 PDF를 만든 뒤 PDF24 OCR을 적용해 봤습니다. OCR 전후의 글자 선택 여부뿐 아니라, 변환된 텍스트를 메모장에 복사해 한글·숫자·영문이 실제로 얼마나 정확하게 인식되는지도 확인했습니다.

PDF 글자 복사가 안 되는 이유

PDF라고 해서 모든 문서의 글자가 실제 텍스트로 저장되어 있는 것은 아닙니다. 문서를 스캔하거나 화면을 이미지로 저장해 PDF로 만든 경우에는 페이지가 사진처럼 구성될 수 있습니다.

이런 이미지형 PDF는 화면에서는 글자가 정상적으로 보이더라도 마우스로 문장을 선택하거나 복사하기 어렵습니다. 이때 필요한 기능이 OCR입니다.

다만 글자가 선택되지 않는다고 해서 모든 경우가 OCR 문제인 것은 아닙니다. PDF의 복사·편집 권한이 제한되어 있거나 사용하는 PDF 프로그램에 따라 선택이 제대로 되지 않는 경우도 있으므로 먼저 원인을 구분해야 합니다.

직접 테스트: 이미지형 PDF는 정말 복사가 안 될까?

실제로 확인하기 위해 한글, 영문, 숫자, 금액, 기호가 포함된 1페이지짜리 테스트 문서를 만들었습니다. 먼저 텍스트가 포함된 정상 PDF로 저장한 뒤, 같은 문서를 이미지로 캡처해 다시 PDF로 만들어 스캔 문서와 비슷한 이미지형 PDF를 준비했습니다.

테스트 문서에는 날짜와 시간, 사람 이름, 금액, 영문 문장, 연속된 숫자와 여러 기호를 넣었습니다. OCR이 단순한 한글 문장뿐 아니라 업무 문서에서 자주 볼 수 있는 정보도 제대로 인식하는지 확인하기 위해서입니다.

이미지형 PDF를 열어 확인해 보니 화면에서는 글자가 정상적으로 보였지만, 문장을 일반 텍스트처럼 선택하고 복사할 수 없었습니다.

OCR 적용 전 글자를 선택할 수 없는 이미지형 PDF 테스트 화면
OCR 적용 전 이미지형 PDF 테스트 화면. 글자가 화면에는 보이지만 텍스트로 선택되지 않았다.

PDF24 OCR로 글자 복사 가능하게 만들기

이미지형 PDF에 텍스트를 인식시키기 위해 이번 테스트에서는 PDF24의 온라인 OCR 도구를 사용했습니다. 테스트 파일에는 개인정보나 실제 업무 자료가 아닌 직접 만든 예제 문서만 사용했습니다.

PDF24 OCR 페이지에서 이미지형 PDF를 업로드한 뒤 인식 언어를 한국어로 선택했습니다. 출력 형식은 PDF로 두고 나머지 보정 옵션은 사용하지 않은 상태에서 OCR을 실행했습니다.

PDF24에서 한국어를 선택한 PDF OCR 테스트 설정 화면
PDF24 OCR 테스트 설정. 언어는 한국어, 출력 형식은 PDF로 설정했다.

OCR 처리가 끝난 뒤 PDF24 결과 화면에는 이번 테스트에서 62개의 단어가 인식됐다고 표시되었습니다. 다만 이 숫자만으로 OCR이 62개 단어를 모두 정확하게 읽었다고 판단할 수는 없습니다. 실제 정확도는 결과 PDF의 텍스트를 직접 복사해 원문과 비교해서 확인했습니다.

PDF24 OCR 완료 후 62개의 단어가 인식됐다고 표시된 결과 화면
이번 테스트의 PDF24 OCR 완료 화면. 62개의 단어가 인식됐다고 표시됐다.

OCR 후 글자는 선택됐지만 인식 오류도 있었다

OCR 처리된 PDF를 다시 열어 확인하니 이전과 달리 문장을 마우스로 선택할 수 있었습니다. 즉, 이미지로만 되어 있던 PDF에 검색·선택 가능한 텍스트가 생성된 것을 확인했습니다.

PDF24 OCR 처리 후 PDF 글자를 선택할 수 있게 된 화면
OCR 처리 후에는 이미지 위의 글자를 텍스트로 선택할 수 있었다.

하지만 글자를 선택할 수 있게 됐다고 해서 OCR 결과가 원문과 완전히 같다는 뜻은 아니었습니다. 결과 PDF의 텍스트 전체를 복사해 메모장에 붙여넣어 원본과 비교하자 여러 인식 오류가 확인됐습니다.

예를 들어 문서 첫 줄의 영문은 제대로 인식되지 않았고, 프로젝트 회의 일정의 일부 글자와 1,284,500원 같은 금액에서도 오류가 발생했습니다. 반면 김민수, 0123456789처럼 정상적으로 인식된 항목도 있었습니다.

PDF24 OCR 결과를 메모장에 복사했을 때 나타난 문자 인식 오류
OCR 결과를 메모장에 붙여넣어 확인한 모습. 화면상 글자는 정상처럼 보여도 실제 복사 텍스트에는 일부 오류가 있었다.
테스트 항목OCR 결과판정
사람 이름 (김민수)정상 인식정상
숫자(0123456789)정상 인식정상
프로젝트 회의 일정일부 글자 오인식오류
금액 1,284,500원숫자,구분 일부 오인식오류
영문 포함 문장일부 문자 크게 오인식오류

이번 결과는 PDF24 OCR의 전체 성능을 평가한 것이 아니라, 화면 캡처로 만든 이미지형 테스트 PDF 1개를 사용한 결과입니다. 원본 이미지의 해상도, 글자 크기, 문서 상태 등에 따라 OCR 결과는 달라질 수 있습니다. 따라서 계약서, 견적서처럼 이름·날짜·금액이 중요한 문서는 OCR 후 반드시 원본과 대조하는 것이 좋습니다.

PDF 글자가 복사되지 않을 때 확인 순서

PDF에서 글자가 복사되지 않는다면 바로 OCR부터 실행하기보다 먼저 원인을 확인하는 것이 좋습니다.

1. 글자를 마우스로 선택할 수 있는지 확인합니다.
글자 단위로 선택된다면 이미지형 PDF가 아닐 가능성이 있습니다. 이 경우 사용 중인 PDF 프로그램이나 문서의 복사 제한 여부를 먼저 확인합니다.

2. 페이지 전체가 이미지처럼 선택된다면 이미지형 PDF인지 확인합니다.
스캔하거나 이미지로 만든 PDF는 화면에 글자가 보여도 실제 텍스트 정보가 없을 수 있습니다.

3. 이미지형 PDF라면 OCR을 사용합니다.
OCR을 적용하면 이미지 속 문자를 인식해 검색하거나 복사할 수 있는 텍스트를 생성할 수 있습니다.

4. OCR 후 중요한 내용은 원본과 비교합니다.
이번 테스트에서도 이름과 숫자 일부는 정상적으로 인식됐지만 영문, 일부 한글, 금액에서는 오류가 발생했습니다. 특히 계약서·견적서처럼 숫자와 이름이 중요한 문서는 OCR 결과만 믿고 사용하지 않는 것이 좋습니다.

온라인 PDF OCR 사용 전 확인할 점

온라인 OCR 도구는 PDF 파일을 서비스 제공업체의 서버로 전송해 처리할 수 있습니다. 따라서 주민등록번호, 계약 내용, 고객정보, 회사 내부자료처럼 민감한 정보가 포함된 PDF라면 업로드 전에 해당 서비스의 개인정보 및 파일 처리 방식을 확인해야 합니다.

PDF24는 현재 공식 안내에서 파일 전송에 SSL을 사용하고, 파일 처리 서버는 독일에 있으며, 서버의 파일은 1시간 후 자동 삭제된다고 설명하고 있습니다. 다만 회사의 보안 규정상 외부 서버 업로드 자체가 금지된 문서라면 온라인 OCR 대신 승인된 사내 프로그램이나 오프라인 방식의 OCR을 사용해야 합니다.

정리: OCR 후에도 결과 확인은 필요하다

PDF의 글자가 이미지로 저장되어 있어 선택하거나 복사할 수 없다면 OCR이 해결 방법이 될 수 있습니다. 이번 테스트에서도 OCR 적용 전에는 선택할 수 없던 글자를 처리 후 선택하고 복사할 수 있었습니다.

다만 실제 복사 결과를 원문과 비교하자 일부 한글과 영문, 금액에서 인식 오류가 발견됐습니다. 따라서 OCR은 글자를 복사 가능하게 만드는 데 유용하지만, 변환 결과가 항상 원문과 동일하다고 가정해서는 안 됩니다.

중요한 업무 문서라면 OCR 처리 후 이름, 날짜, 금액, 숫자를 원본과 한 번 더 대조하는 것이 안전합니다.