Playcloud8
문서도구

스캔한 PDF에서는 왜 글자를 선택할 수 없을까

2026-07-18  ·  조회 41
PDF 파일을 열었을 때 마우스로 문장을 드래그해서 복사할 수 있는 파일이 있는가 하면, 아무리 드래그해도 텍스트가 선택되지 않고 이미지 전체만 선택되는 파일이 있습니다. 겉보기엔 둘 다 똑같은 문서처럼 보이지만, 내부적으로는 완전히 다른 방식으로 만들어진 파일입니다. 워드나 한글 같은 프로그램에서 "PDF로 저장"을 했을 경우, PDF 내부에는 실제 문자 정보(어떤 글자가 어느 위치에 어떤 글꼴로 있는지)가 그대로 담깁니다. 이런 PDF는 텍스트 기반 PDF라고 부르며, 문자 데이터가 있기 때문에 검색과 복사가 자유롭고 파일 용량도 상대적으로 작습니다. 반면 종이 문서를 스캐너나 사진으로 찍어서 만든 PDF는 사실 문서 전체가 하나의 큰 이미지 파일일 뿐입니다. 우리 눈에는 문자로 보이지만, 컴퓨터 입장에서는 그저 픽셀들의 집합이지 "이것은 ㄱ이라는 글자다"라는 정보는 전혀 담겨 있지 않습니다. 그래서 이런 이미지 기반 PDF는 텍스트를 선택하거나 검색하는 것이 원천적으로 불가능합니다. 이 문제를 해결하는 기술이 바로 OCR(광학 문자 인식)입니다. OCR은 이미지 속 픽셀 패턴을 분석해 "이 부분은 ㄱ 모양이니 문자 ㄱ일 확률이 높다"는 방식으로 이미지를 실제 문자 데이터로 변환해줍니다. 이 과정을 거치면 스캔한 문서라도 검색과 복사가 가능한 텍스트를 얻을 수 있습니다. 이 사이트의 이미지 OCR 변환기는 사진이나 스캔 이미지를 업로드하면 그 안의 문자를 인식해 텍스트로 추출해주며, 인식된 텍스트를 검토하고 원하는 포맷으로 바로 변환할 수 있습니다.