변환·스캔읽는 시간: 5분발행일: 2026-10-02

스캔된 이미지 PDF에서 글자 복사 및 검색(OCR) 가능하게 만드는 방법

드래그나 글자 복사가 되지 않는 그림 형태의 스캔 PDF를 인공지능 OCR(광학 문자 인식) 기술로 텍스트 레이어로 전환하여 검색, 복사, 편집이 가능하도록 만드는 방법을 알아봅니다.

mypickpdf 기술 에디토리얼 팀

웹 보안 및 문서 엔지니어링 리서치

지금 바로 본문 가이드 내용 적용해보기

100% 무료, 로그인 없이 브라우저에서 바로 처리할 수 있습니다.

PDF 텍스트 OCR 추출기 바로가기

1. 왜 어떤 PDF는 글자가 긁히고, 어떤 PDF는 안 긁힐까?

도서관에서 복사한 논문, 관공서에서 받은 공문서, 복합기에서 스캔한 문서를 열었을 때 마우스로 글자를 드래그해도 아무 반응이 없거나 문서 전체가 통째로 선택되는 경험이 있으실 것입니다.

그 이유는 문서의 생성 방식 때문입니다:

  • 디지털 네이티브 PDF (True PDF): 워드나 한글에서 'PDF로 저장'한 문서로, 글자 하나하나가 텍스트 코드와 폰트 좌표로 살아있어 즉시 드래그 및 복사(Ctrl+C)가 가능합니다.
  • 래스터 이미지 PDF (Scanned PDF): 복합기나 카메라가 종이 문서를 사진 찍듯 캡처한 이미지 덩어리입니다. 눈에는 글자로 보이지만 컴퓨터의 눈에는 그저 '점(픽셀)들의 모임'일 뿐입니다.
  • 이러한 이미지 PDF에서 글자를 살려내려면 OCR (Optical Character Recognition, 광학 문자 인식) 기술이 필수적입니다.


    2. OCR 기술의 동작 원리

    OCR 엔진은 이미지 속 글자들을 다음과 같은 3단계 과정을 거쳐 판독합니다:

    1. 전처리 (Pre-processing): 이미지의 기울기를 바로잡고 명암 대비(Contrast)를 극대화하여 글자와 배경을 선명하게 분리합니다.

    2. 패턴 매칭 및 특징 추출 (Feature Extraction): 'ㄱ', 'ㄴ', 'A', 'B' 등 글자의 획과 곡률을 인공지능 신경망 알고리즘으로 대조 분석합니다.

    3. 텍스트 레이어 합성: 분석된 텍스트 데이터를 원본 이미지의 정확한 위치 뒤편에 투명한 텍스트 레이어로 얹어, 사용자가 마우스로 드래그하고 키워드로 검색(Ctrl+F)할 수 있게 만듭니다.


    3. 한국어 OCR 인식 정확도를 99%까지 끌어올리는 팁

  • 원본 해상도 유지: 스캔 시 최소 300 DPI 이상으로 스캔된 문서여야 자음과 모음이 뭉개지지 않습니다.
  • 기울기 보정: 문서가 5도 이상 기울어져 있으면 문자 인식률이 급격히 떨어집니다. 스캔 시 똑바로 정렬하세요.
  • 특수 폰트 주의: 필기체나 캘리그래피 글꼴보다는 고딕체, 명조체 계열의 인쇄용 활자체에서 가장 높은 정확도를 보입니다.

  • 4. 실전 활용 시나리오

  • 논문 및 서적 연구: 수백 페이지 스캔 도서에서 필요한 키워드(Ctrl+F)를 즉시 검색하여 인용구 복사
  • 회계 장부 및 세금계산서: 종이 영수증의 금액과 사업자등록번호를 텍스트로 추출하여 엑셀 장부에 붙여넣기
  • 외국어 문서 번역: 번역기에 직접 칠 수 없는 스캔본 계약서 텍스트를 OCR로 추출 후 구글/파파고 번역기로 전송
  • mypickpdf의 [PDF OCR 텍스트 추출 도구](/ocr-pdf)를 활용하시면 설치 없이 즉시 이미지 속 글자를 텍스트로 복원하실 수 있습니다.

    Q&A

    관련 자주 묻는 질문 (FAQ)

    본 가이드 주제와 관련하여 실무에서 가장 많이 묻는 질문들입니다.

    인쇄 활자체에 비해 손글씨는 개인 필체에 따라 인식률 편차가 큽니다. 또박또박 작성된 정자체는 인식 가능하지만 흘려 쓴 필기체는 일부 오탈자가 발생할 수 있어 검수가 필요합니다.