용어
텍스트 레이어
텍스트 레이어는 문서 안에 들어 있는 기계 판독 텍스트입니다. 보이는 페이지 이미지 뒤에 배치되는 경우가 많으며 문서를 검색하고 글자를 선택하거나 소프트웨어로 처리할 수 있게 합니다.
텍스트 레이어와 보이는 글자
워드프로세서, 브라우저, 디자인 도구에서 만든 디지털 문서는 보통 원래 파일 구조 안에 글자를 포함합니다. 처음부터 기계가 읽을 수 있습니다.
스캔이나 이미지 기반 문서의 텍스트 레이어는 다릅니다. 원래 픽셀로만 존재하던 글자를 소프트웨어가 처리할 수 있도록 보통 OCR로 나중에 추가합니다. 화면에서 똑같이 보이는 문서라도 하나는 원래 디지털 텍스트를, 다른 하나는 OCR로 만든 텍스트 레이어를 사용할 수 있습니다.
디지털 원본에서는 선택과 검색이 바로 작동합니다. 이미지 기반 파일에 텍스트 레이어가 없으면 사람이 글자를 선명하게 볼 수 있어도 소프트웨어는 선택하거나 검색하지 못합니다.
텍스트 레이어가 중요한 곳
문서를 눈으로 보는 것 이상으로 활용하려면 텍스트 레이어가 필요합니다.
- 검색 가능한 PDF — 텍스트 레이어가 있어야 문서 찾기 기능이 글자를 검색할 수 있습니다.
- 접근성 — 화면 낭독기가 글자를 읽는 데 필요합니다. 다만 올바른 읽기 순서, 제목 구조, 대체 텍스트까지 갖추려면 문서 태그도 별도로 필요합니다.
- 문서 색인 — 검색 엔진과 문서 관리 시스템은 페이지 이미지가 아니라 텍스트 레이어를 색인합니다.
- 복사와 붙여넣기 — 스캔이나 스크린샷 속 글자를 선택해 복사하려면 기계 판독 텍스트가 있어야 합니다.
- 스크린샷 PDF 내보내기 — 캡처한 화면을 PDF로 만들 때 텍스트 레이어를 넣으면 나중에 인용하고 검색할 수 있습니다.
텍스트 레이어를 만드는 방식
디지털 원본 문서는 만들 때부터 텍스트 구조가 있으므로 별도 단계가 필요하지 않습니다.
스캔, 사진, 스크린샷 같은 이미지 기반 문서에는 텍스트 레이어를 추가해야 합니다. 가장 흔한 방법은 OCR입니다. 인식 엔진이 페이지 이미지에서 글자와 단어를 찾아 결과를 보이는 화면 뒤의 숨은 텍스트 레이어로 넣습니다.
일부 스크린샷 도구도 내보낼 때 OCR을 실행해 검색 가능한 파일을 만듭니다. 나중에 별도 도구로 처리하는 단계를 줄일 수 있습니다.
흔한 실수
- 눈으로 읽을 수 있으면 텍스트 레이어도 있다고 생각합니다. 페이지가 선명해 보여도 이미지 전용일 수 있습니다. 직접 글자를 선택하거나 검색해 보세요.
- 텍스트 레이어와 OCR을 같은 말로 씁니다. 둘은 연결돼 있지만 OCR은 인식 과정이고 텍스트 레이어는 문서에 들어가는 결과입니다.
- 텍스트 레이어가 시각적 레이아웃까지 보존한다고 생각합니다. 텍스트와 페이지 위의 대략적인 위치를 저장하지만 색상, 서식, 의미 구조를 모두 나타내지는 않습니다. 주목적은 검색과 선택입니다.
- OCR 뒤 정확성을 확인하지 않습니다. 흐린 이미지, 특이한 글꼴, 여러 단으로 구성된 복잡한 페이지에서는 잘못 인식한 글자가 들어갈 수 있습니다. 중요한 문서는 원본과 대조하세요.
자주 묻는 질문
페이지가 이미지처럼 보여도 텍스트 레이어가 있을 수 있나요?
네. 스캔 이미지처럼 보이는 문서에도 검색과 선택을 지원하는 텍스트 레이어가 들어 있을 수 있습니다.
텍스트 레이어와 OCR은 같은 것인가요?
완전히 같지는 않습니다. OCR은 글자를 인식하는 과정이고 텍스트 레이어는 그 결과를 문서 안에 저장하는 방식 중 하나입니다.
문서에 텍스트 레이어가 있는지 어떻게 확인하나요?
페이지에서 글자를 선택해 보세요. 단어마다 강조할 수 있으면 텍스트 레이어가 있습니다. 아무것도 선택되지 않는다면 이미지 전용일 가능성이 높습니다.
PDF의 텍스트 레이어는 어디에 저장되나요?
페이지 이미지 뒤의 위치 정보와 함께 PDF 파일 내부에 들어갑니다. 별도 파일이 아니라 문서 구조의 일부입니다.
텍스트 레이어에도 오류가 있을 수 있나요?
네. OCR로 만들었다면 흐린 이미지, 특이한 글꼴, 복잡한 레이아웃에서 인식 오류가 생길 수 있습니다.
출처
- OCRmyPDF — OCRmyPDF
- Adobe Acrobat으로 온라인 PDF OCR 처리 — Adobe
- PDF7: 스캔 PDF 문서에 OCR을 실행해 실제 텍스트 제공하기 — W3C