용어
이미지 전용 PDF
이미지 전용 PDF는 기계가 읽을 수 있는 텍스트 없이 페이지 이미지로만 이뤄진 PDF입니다. 사람이 보기에는 글을 읽을 수 있지만 검색하거나 선택하거나 색인할 수 없습니다.
이미지 전용 PDF와 검색 가능한 PDF의 차이
눈에 보이는 화면 너머 파일 안에 무엇이 들어 있는지가 두 형식을 가릅니다.
이미지 전용 PDF는 각 페이지를 픽셀 격자인 래스터 이미지로 저장합니다. 페이지에 보이는 글자는 사진 속 글자처럼 이미지의 일부입니다. 파일 안에 기계가 읽을 문자가 없습니다. PDF 뷰어는 이미지를 표시하므로 글을 읽을 수 있어 보이지만 소프트웨어 입장에서는 픽셀만 있는 페이지입니다.
검색 가능한 PDF에는 보이는 글자의 위치에 맞춰 배치한 기계 판독용 문자, 즉 텍스트 레이어가 있습니다. 디지털로 만든 원본 문서의 텍스트일 수도 있고 스캔한 뒤 OCR로 인식한 결과일 수도 있습니다. 이 레이어 덕분에 검색, 선택, 복사·붙여넣기, 화면 읽기 프로그램 접근이 가능합니다.
두 PDF의 겉모습은 똑같을 수 있습니다. 하나는 글자의 사진이고 다른 하나는 실제 텍스트 데이터까지 담았다는 기능상의 차이가 있습니다.
이미지 전용 PDF가 만들어지는 과정
이미지 전용 PDF는 보통 다음 과정에서 생깁니다.
- 종이 문서 스캔 — 스캐너가 각 페이지를 사진으로 찍어 PDF에 묶습니다. 그다음 OCR을 실행하지 않으면 이미지 전용 파일이 됩니다.
- 스크린샷이나 이미지를 PDF로 내보내기 — 텍스트 없이 이미지만 PDF에 넣으면 이미지 전용 파일이 됩니다.
- 일부 앱에서 PDF로 인쇄 — 인쇄 과정에서 콘텐츠를 래스터 이미지로 바꾸는 작업은 원래 텍스트 데이터를 버리고 이미지 전용 결과를 만들 수 있습니다.
- 팩스와 문서 이미징 시스템 — 오래된 문서 관리 시스템은 들어온 팩스와 스캔을 이미지 전용 PDF로 보관하는 경우가 많습니다.
공통점은 글자가 파일 안에 문자로 인코딩된 적이 없고 이미지의 일부로만 캡처됐다는 것입니다.
스크린샷을 PDF로 만드는 작업에서는 시각적 재현을 먼저 맞추고 나중에 OCR을 추가하지 않을 때 이런 일이 생깁니다. 결과물은 깔끔해 보여도 검색, 복사·붙여넣기, 보조 기술에는 보이지 않습니다.
이미지 전용 PDF 확인 방법
가장 빠른 방법은 글자를 선택해 보는 것입니다. PDF를 뷰어에서 열고 단어 하나를 드래그해 강조해 보세요. 정확한 텍스트 커서로 단어별 선택이 된다면 텍스트 레이어가 있습니다. 페이지 전체가 한 덩어리로 선택되거나 아무것도 선택되지 않으면 이미지 전용일 가능성이 큽니다.
Mac에서는 Cmd+F, Windows에서는 Ctrl+F로 페이지에 분명히 보이는 단어를 검색해 볼 수도 있습니다. 결과가 없다면 텍스트 레이어가 없는 것입니다.
코드로 확인하려면 Poppler에 포함된 pdftotext나 PDF 파싱 라이브러리로 텍스트 콘텐츠를 추출하세요. 눈에 글자가 보이는 페이지에서 빈 문자열이나 공백만 나온다면 이미지 전용입니다.
이미지 전용 PDF에서 흔히 하는 실수
- 모든 PDF에서 검색할 수 있다고 생각합니다. Ctrl+F가 작동하지 않으면 텍스트 레이어가 없는 파일임을 알아차리지 못하고 뷰어가 고장 났다고 여길 수 있습니다.
- 보관용으로 이미지 전용 PDF를 공유합니다. 문서 관리 시스템과 검색 엔진은 이런 PDF를 색인하지 못합니다. 보관소에 파일이 있어도 시간이 지나면 검색으로 찾을 수 없는 콘텐츠가 됩니다.
- 접근성을 무시합니다. 화면 읽기 프로그램은 이미지 전용 페이지를 해석하지 못합니다. 화면 읽기 프로그램을 쓰는 사람에게 이런 PDF만 제공하면 콘텐츠에 접근할 수 없습니다. OCR 텍스트 레이어를 추가해 해결할 수 있습니다.
- 정확성을 확인하지 않고 OCR 결과를 사용합니다. OCR은 완벽하지 않습니다. 해상도가 낮은 스캔, 특이한 글꼴, 복잡한 레이아웃에서는 특히 오류가 납니다. 중요한 문서는 텍스트 레이어에 잘못 인식된 글자가 없는지 검토하세요.
자주 묻는 질문
PDF가 이미지 전용인지 어떻게 확인하나요?
커서로 글자를 선택해 보세요. 단어 하나씩 선택할 수 없거나 페이지 전체가 한 덩어리로 선택된다면 텍스트 레이어 없이 이미지만 들어 있는 PDF일 가능성이 큽니다.
스캔한 PDF는 왜 이미지 전용인가요?
스캐너는 각 페이지를 사진으로 찍습니다. 결과 파일에는 기계가 읽는 글자가 아니라 픽셀로 이뤄진 래스터 이미지가 들어갑니다. OCR 처리를 하지 않으면 이미지 속 글자는 그림의 일부일 뿐입니다.
이미지 전용 PDF 안에서 검색할 수 있나요?
일반 검색(Ctrl+F 또는 Cmd+F)으로는 찾을 수 없습니다. PDF 뷰어는 기계가 읽는 텍스트만 검색합니다. 콘텐츠를 검색하려면 OCR로 만든 텍스트 레이어를 PDF에 추가해야 합니다.
검색 가능한 PDF로 바꾸면 겉모습도 달라지나요?
아닙니다. OCR은 페이지 이미지 뒤에 보이지 않는 텍스트 레이어를 추가합니다. 겉모습은 그대로이며 텍스트 레이어는 표시가 아니라 검색, 선택, 접근성에 사용됩니다.
화면 읽기 프로그램이 이미지 전용 PDF를 읽을 수 있나요?
읽을 수 없습니다. 화면 읽기 프로그램은 기계가 읽을 수 있는 텍스트를 바탕으로 내용을 소리 내어 읽습니다. 이미지 전용 PDF에는 텍스트 데이터가 없어 페이지 내용을 해석하지 못합니다.
출처
- PDF7: 스캔한 PDF 문서에 OCR을 실행해 실제 텍스트 제공하기 — W3C
- 스캔 문서의 텍스트 인식하기 — Adobe