1. 왜 어떤 PDF는 글자가 긁히고, 어떤 PDF는 안 긁힐까?
도서관에서 복사한 논문, 관공서에서 받은 공문서, 복합기에서 스캔한 문서를 열었을 때 마우스로 글자를 드래그해도 아무 반응이 없거나 문서 전체가 통째로 선택되는 경험이 있으실 것입니다.
그 이유는 문서의 생성 방식 때문입니다:
이러한 이미지 PDF에서 글자를 살려내려면 OCR (Optical Character Recognition, 광학 문자 인식) 기술이 필수적입니다.
2. OCR 기술의 동작 원리
OCR 엔진은 이미지 속 글자들을 다음과 같은 3단계 과정을 거쳐 판독합니다:
1. 전처리 (Pre-processing): 이미지의 기울기를 바로잡고 명암 대비(Contrast)를 극대화하여 글자와 배경을 선명하게 분리합니다.
2. 패턴 매칭 및 특징 추출 (Feature Extraction): 'ㄱ', 'ㄴ', 'A', 'B' 등 글자의 획과 곡률을 인공지능 신경망 알고리즘으로 대조 분석합니다.
3. 텍스트 레이어 합성: 분석된 텍스트 데이터를 원본 이미지의 정확한 위치 뒤편에 투명한 텍스트 레이어로 얹어, 사용자가 마우스로 드래그하고 키워드로 검색(Ctrl+F)할 수 있게 만듭니다.
3. 한국어 OCR 인식 정확도를 99%까지 끌어올리는 팁
4. 실전 활용 시나리오
mypickpdf의 [PDF OCR 텍스트 추출 도구](/ocr-pdf)를 활용하시면 설치 없이 즉시 이미지 속 글자를 텍스트로 복원하실 수 있습니다.