용어
문서 스캔
문서 스캔은 종이, 영수증, 신분증, 인쇄물을 스캐너, 휴대전화 카메라, 전용 스캔 앱으로 디지털 이미지나 PDF로 바꾸는 작업입니다.
스캔과 사진 촬영의 차이
문서를 사진으로 찍는 일과 스캔하는 일은 비슷해 보이지만 결과에는 큰 차이가 있습니다.
사진은 현재 조명에서 한 방향으로 보이는 문서를 그대로 기록합니다. 문서가 직사각형이 아니라 사다리꼴처럼 보이는 원근 왜곡, 밝은 부분과 그림자가 섞인 고르지 않은 조명, 평평하지 않은 페이지의 휘어진 가장자리, 문서 주변의 배경까지 함께 들어가곤 합니다.
평판 스캐너나 소프트웨어 기반 모바일 스캔 앱은 이런 문제를 보정합니다. 원근 보정으로 문서를 정확한 직사각형으로 펴고 자동 자르기로 배경을 제거합니다. 대비를 높여 조명 차이를 줄이고 페이지 위의 글자를 선명하게 만듭니다. 결과는 깨끗하고 평평하며 방향이 올바른 평판 스캐너 이미지와 비슷합니다.
이 차이는 이후 작업에서 중요합니다. 문서 사진은 사람이 읽을 수 있어도 형태가 고르지 않아 OCR 처리, 자동 분류, 보관 과정에서 문제가 생길 수 있습니다. 제대로 스캔한 문서는 더 안정적으로 처리되고 공유하거나 인쇄할 때도 정돈돼 보입니다.
문서 스캔을 사용하는 곳
- 영수증과 비용 기록: 구매 직후 영수증을 스캔하면 감열지가 흐려지기 전에 디지털 기록을 남깁니다. 종이보다 정리하고 검색하고 비용 정산에 제출하기 쉽습니다.
- 계약서와 법률 문서 디지털화: 서명한 계약서, 임대차 문서, 법률 자료를 검색 가능한 PDF로 바꿔 접근하고 백업하고 키워드로 찾습니다.
- 신분증과 자격 증명 기록: 여권, 운전면허증, 자격 증명을 검증, 신청, 보안이 적용된 보관 절차에 맞춰 스캔합니다.
- 의료와 보험 기록: 종이 양식, 검사 결과, 보험 카드를 개인 기록으로 디지털화하고 의료 서비스 제공자에게 안전한 방식으로 공유합니다.
- 학업과 연구 자료: 책 페이지, 학술지 글, 손으로 쓴 메모를 스캔해 디지털 주석, 인용, 자료 정리에 사용합니다.
스캔과 OCR
스캔만으로는 글자의 이미지가 만들어질 뿐 실제 텍스트 데이터가 생기지는 않습니다. 사람에게는 글자로 보이지만 컴퓨터에는 픽셀 배열입니다.
OCR(Optical Character Recognition)은 스캔 이미지를 분석하고 글자 모양을 찾아 기계가 읽는 텍스트로 바꿉니다. OCR 결과를 PDF에 텍스트 레이어로 넣으면 원본 스캔과 같은 모습을 유지하면서 글자를 선택하고 검색하고 복사하는 검색 가능한 PDF가 됩니다.
OCR 결과는 스캔 화질의 영향을 크게 받습니다. 300DPI 이상의 선명하고 대비가 높은 스캔은 글자를 더 정확하게 인식합니다. 흐리거나 대비가 낮거나 기울어진 스캔은 직접 고쳐야 할 오류를 만듭니다.
스캔과 OCR을 하나의 과정으로 묶으면 문서를 캡처하고 처리한 뒤 검색 가능한 PDF로 내보냅니다. OCR을 별도로 실행하는 단계를 줄여 여러 문서를 이어서 처리할 때 특히 유용합니다. 종이 문서 묶음을 검색 가능한 디지털 보관 자료로 바꿉니다.
흔한 실수
- 낮은 해상도로 스캔합니다. 200DPI보다 낮은 이미지는 사람이 읽어도 OCR이 정확하게 처리하기 어려울 수 있습니다. 처리하거나 보관할 문서는 최소 300DPI로 스캔하세요.
- 문서를 바로 놓지 않습니다. 문서가 비뚤어지면 스캔도 비뚤어집니다. 여러 앱이 작은 회전을 자동으로 보정하지만 처음부터 문서를 바르게 놓는 편이 가장 좋은 결과를 만듭니다.
- 보관용 문서를 JPG로 저장합니다. JPG의 손실 압축은 특히 낮은 화질 설정에서 글자 가장자리를 흐립니다. 보관에는 한 페이지라면 PNG, 여러 페이지라면 PDF를 사용해 글자를 선명하게 유지하세요.
- 스캔 PDF에 OCR을 적용하지 않습니다. 스캔 이미지만 들어 있는 PDF는 검색, 선택, 색인이 되지 않습니다. 나중에 검색하거나 글자를 추출할 문서에는 OCR을 적용하세요.
자주 묻는 질문
휴대전화로 문서를 스캔할 수 있나요?
네. 최신 휴대전화 카메라와 스캔 앱을 함께 쓰면 일상적인 문서 대부분에서 전용 스캐너와 비슷한 결과를 얻습니다. 앱이 원근 보정, 자르기, 대비 향상을 자동으로 처리합니다.
문서 스캔과 사진 촬영은 무엇이 다른가요?
사진은 원근 왜곡, 그림자, 고르지 않은 조명까지 카메라에 보이는 대로 기록합니다. 스캔은 이런 문제를 보정해 평평하고 밝기가 일정하며 가장자리가 잘린 실제 스캔 같은 결과를 만듭니다.
스캔한 문서는 어떤 형식으로 저장해야 하나요?
PDF는 레이아웃을 유지하고 검색용 텍스트 레이어를 넣을 수 있어 여러 페이지 문서의 표준 형식입니다. 한 페이지라면 무손실 화질에는 PNG, 작은 파일에는 JPG를 사용할 수 있습니다.
문서를 스캔하면 바로 검색할 수 있나요?
자동으로 검색 가능해지는 것은 아닙니다. 기본 스캔은 실제 텍스트 데이터가 아닌 글자의 사진입니다. 검색하려면 OCR(광학 문자 인식)로 화면의 글자를 감지해 기계가 읽는 텍스트 레이어로 바꿔야 합니다.
문서는 어떤 해상도로 스캔해야 하나요?
대부분의 문서에는 300DPI가 표준이며 OCR과 읽기 쉬운 출력에 충분한 세부 정보를 담습니다. 작은 글자가 있거나 세부 표현을 최대한 보존해야 한다면 600DPI를 사용하세요. 더 높은 해상도는 파일을 크게 늘리는 데 비해 추가 효과가 작아집니다.
출처
- 연방 기관 디지털화 지침 - 정지 이미지 — FADGI
- iPhone 또는 iPad에서 문서 스캔하기 — Apple