용어
OCR
OCR은 광학 문자 인식(optical character recognition)의 약자입니다. 이미지 기반 문서, 스캔, 스크린샷 안의 글자를 찾아 검색·선택·복사·색인할 수 있는 기계 판독용 텍스트로 바꿉니다.
OCR의 작동 방식
OCR 과정은 세 단계로 진행됩니다. 먼저 글자를 찾기 쉽도록 원본 이미지를 곧게 펴고 잡음을 없애며 대비를 조절합니다. 그런 다음 OCR 엔진이 개별 문자나 단어를 찾습니다. 최신 엔진은 이 단계에 신경망을 사용해 예전의 템플릿 대조 방식보다 다양한 글꼴과 복잡한 레이아웃을 훨씬 잘 처리합니다. 마지막으로 인식한 문자를 기계 판독용 텍스트로 조합해 문서 안에 넣거나 별도 파일로 내보내거나 검색 색인에 사용합니다.
정확도에 가장 큰 영향을 주는 요소는 원본 이미지의 품질입니다. 대비가 좋고 깨끗한 고해상도 원본은 거의 완벽한 결과를 낼 수 있지만 흐리거나 기울어진 이미지는 어떤 엔진을 써도 결과가 눈에 띄게 나빠집니다.
OCR을 쓰는 곳
문서가 이미지에서 시작할 때 OCR이 필요합니다. 스캔한 페이지, 촬영한 서류, 내보낸 스크린샷, 이미지 전용 PDF는 사람이 읽기에는 문제가 없어도 OCR 없이는 검색, 텍스트 선택, 자동 처리가 불가능합니다.
주요 사용 사례는 다음과 같습니다.
- 스캔 문서 — 종이 보관 자료를 검색 가능한 디지털 파일로 바꿉니다.
- 스크린샷 — 캡처한 앱 화면, 대시보드, 웹페이지에서 글자를 추출해 인용, 검색, 재사용합니다.
- 영수증과 청구서 — 촬영한 서류에서 품목과 합계를 읽어 회계나 경비 추적에 사용합니다.
- 신분증과 양식 — 이미지 기반 문서의 구조화된 필드를 읽어 가입이나 확인 절차에 사용합니다.
- 이미지 전용 PDF — 페이지 이미지만 있는 PDF에 검색 가능한 텍스트 레이어를 더해 검색 가능한 PDF로 바꿉니다.
스크린샷 OCR
스크린샷은 흔하지만 OCR 원본으로는 자주 간과됩니다. 스캔한 종이와 달리 글자가 깨끗하고 글꼴이 일정하며 대비가 높아 인식에 특히 잘 맞습니다.
사람들은 대시보드, 오류 메시지, 채팅 대화, 웹페이지, 앱 인터페이스를 매일 캡처합니다. OCR이 없으면 글자가 이미지 안에 갇혀 눈으로 볼 수만 있고 검색, 복사, 색인은 할 수 없습니다. OCR을 적용하면 같은 글자가 기계 판독용 데이터가 돼 검색 가능한 PDF에 넣을 수 있습니다.
일부 스크린샷 도구는 OCR을 내장해 별도 인식 과정을 거치지 않아도 처음부터 검색 가능한 파일을 내보냅니다.
OCR에서 흔히 하는 실수
- 완벽한 결과를 기대합니다. OCR은 인식 과정이지 단순한 형식 변환이 아닙니다. 이미지 품질, 글자 간격, 글꼴, 레이아웃 복잡도에 따라 결과가 달라집니다. 검토하지 않고 최종 텍스트로 사용하면 이후 문서에 오류가 생길 수 있습니다.
- 품질이 낮은 이미지에 OCR을 실행합니다. 흐리거나 해상도가 낮거나 조명이 나쁜 원본은 엔진이 좋아도 인식 결과가 나쁩니다. 먼저 대비를 조절하고 이미지를 곧게 펴며 잡음을 없애면 정확도가 분명히 좋아집니다.
- OCR이 레이아웃도 보존한다고 생각합니다. OCR은 시각 구조가 아니라 글자를 복원합니다. 엔진이 레이아웃을 이해하지 못하면 여러 단, 표, 사이드바의 읽기 순서가 뒤섞일 수 있습니다.
- OCR을 문서 형식과 혼동합니다. OCR은 인식 단계입니다. 내장 텍스트 레이어가 있는 검색 가능한 PDF처럼 OCR로 만드는 결과물이 형식입니다.
- '문자 인식'과 'OCR'을 서로 다른 뜻으로 씁니다. 두 표현은 겹칩니다. 특히 스캔, 스크린샷, 이미지 기반 원본에서 글자를 복원할 때는 OCR이 더 정확하고 널리 정착된 용어입니다.
자주 묻는 질문
OCR과 문자 인식은 같은가요?
두 표현을 넓은 의미로 함께 쓰는 경우가 많지만 스캔, 스크린샷, 이미지 기반 문서 안의 글자를 인식하는 기술에는 OCR이라는 용어가 더 널리 정착돼 있습니다.
OCR은 언제나 완벽한 텍스트를 만드나요?
아닙니다. 문서를 검색하고 복사할 수 있게 만들지만 인식 품질은 이미지 품질, 언어, 레이아웃, 사용하는 OCR 시스템에 따라 달라집니다.
OCR로 손글씨도 읽을 수 있나요?
일부 OCR 엔진은 손글씨 인식을 시도하지만 정확도 차이가 큽니다. 반듯하게 인쇄된 글자를 가장 잘 읽으며 흘림체와 알아보기 어려운 손글씨는 대부분의 시스템에 여전히 까다롭습니다.
OCR은 어떤 파일 형식을 처리하나요?
PNG, JPG, TIFF, 이미지 전용 PDF, 스크린샷처럼 이미지 기반 원본을 처리할 수 있습니다. 기계가 읽는 문자가 아니라 픽셀로 그려진 글자가 보이면 됩니다.
최신 OCR은 얼마나 정확한가요?
화질이 좋고 깨끗하게 인쇄된 글자에서는 문자 정확도가 거의 완벽할 수 있습니다. 해상도가 낮거나 글꼴이 특이하거나 레이아웃이 복잡하거나 대비가 낮으면 결과가 나빠집니다.
출처
- Adobe Acrobat으로 온라인 OCR PDF 만들기 — Adobe
- Tesseract 사용자 설명서 — Tesseract OCR
- PDF7: 스캔한 PDF 문서에 OCR을 실행해 실제 텍스트 제공하기 — W3C
- 광학 문자 인식이란? — IBM
- OCR이란? — Adobe