OCR 사용법: 사진·PDF 글자 추출 정확도를 높이는 방법 관련 이미지 1
사진과 PDF에서 OCR로 글자를 추출하고 검수하는 과정을 설명하는 썸네일

OCR은 광학 문자 인식의 줄임말로, 사진이나 스캔 PDF 속 글자를 복사·검색·편집할 수 있는 텍스트로 변환합니다. 영수증, 안내문, 책 일부처럼 다시 입력하기 번거로운 자료에 유용하지만 결과가 원문과 항상 같지는 않습니다.

정확도를 높이려면 글자가 충분히 크고 선명하며, 문서가 기울지 않고 배경과 글자의 대비가 분명해야 합니다. 변환 뒤에는 숫자, 날짜, 고유명사, 표의 행·열을 원본과 대조해야 합니다. 중요한 계약이나 금액 자료는 OCR 결과만 믿고 원본을 버리면 안 됩니다.

OCR 사용 전 선택표

원본 준비 방법 주요 검수
스캔 PDF 페이지 방향과 해상도 확인 페이지 누락·열 순서
휴대폰 사진 정면 촬영·그림자 제거 가장자리 글자
영수증 구김을 펴고 대비 확보 금액·소수점·날짜
표 문서 행과 열 선명하게 촬영 셀 대응·병합 영역

1. OCR이 하는 일

OCR은 이미지의 선과 형태를 분석해 문자 후보를 찾고 텍스트로 바꿉니다. 복사할 수 없던 글자가 검색 가능한 내용이 되므로 문서 정리와 접근성이 좋아질 수 있습니다.

Sponsored

다만 사진의 배경 무늬, 손글씨, 특수 글꼴, 낮은 해상도는 문자 모양을 흐리게 만듭니다. 결과는 초안으로 보고 원본 이미지와 함께 확인하는 절차가 필요합니다.

2. 사진을 정면에서 촬영하기

카메라가 문서에 비스듬하면 줄 간격과 글자 폭이 위치마다 달라집니다. 문서 네 모서리가 화면 안에 들어오도록 정면에서 촬영하고, 자동 원근 보정 결과가 글자를 잘라내지 않았는지 확인하세요.

책처럼 가운데가 휘는 자료는 페이지를 무리하게 누르지 말고 각 페이지를 따로 촬영합니다. 휘어진 줄이 심하면 한 번에 많은 면을 담기보다 문단 단위로 나누는 편이 낫습니다.

3. 빛과 대비 맞추기

유광 종이는 조명이 반사돼 흰 반점이 생길 수 있습니다. 빛이 한쪽에 몰리지 않도록 위치를 바꾸고, 휴대폰이나 손의 그림자가 글자 위에 놓이지 않게 합니다.

Sponsored

밝기 보정을 지나치게 하면 얇은 획이 사라지고, 대비를 과하게 올리면 글자 가장자리가 뭉칠 수 있습니다. 확대했을 때 자음과 모음의 획이 분리돼 보이는 정도로 조정하세요.

4. 해상도와 글자 크기

Google Drive 공식 안내는 텍스트 높이가 10픽셀 이상이어야 한다고 설명합니다. 작은 글자를 멀리서 찍으면 확대해도 실제 정보가 복원되지 않으므로 카메라를 가까이 옮기거나 구역별로 촬영합니다.

고해상도 파일은 유리하지만 파일 용량 제한이 있는 서비스도 있습니다. 필요한 페이지만 남기고 품질을 확인한 뒤 업로드하며, 압축 과정에서 글자 경계가 깨지지 않았는지 다시 봅니다.

5. 이미지와 PDF 형식 확인

Google Drive는 PDF와 JPEG, PNG, GIF 등의 사진 파일을 텍스트로 변환하는 방법을 안내합니다. 서비스마다 지원하는 형식과 파일 크기, 페이지 수가 다르므로 업로드 전 공식 도움말을 확인하세요.

암호로 보호된 PDF나 촬영 제한 자료는 변환이 되지 않을 수 있습니다. 보호를 우회하지 말고 문서 제공처의 텍스트 버전이나 접근 가능한 형식을 요청합니다.

6. Google Drive에서 변환

컴퓨터에서 이미지나 PDF를 Drive에 올린 뒤 파일을 마우스 오른쪽 버튼으로 누르고 연결 앱에서 Google Docs를 선택하는 방식이 안내됩니다. 변환된 문서에는 이미지와 인식된 텍스트가 함께 나타날 수 있습니다.

굵게, 글꼴 크기, 줄바꿈 일부는 유지될 수 있지만 목록, 표, 열, 각주와 미주는 그대로 보존되지 않을 수 있습니다. 문서 구조가 중요하면 원본을 옆에 열고 새로 정리해야 합니다.

7. OneNote에서 그림 글자 복사

OneNote 데스크톱 앱은 삽입한 그림을 마우스 오른쪽 버튼으로 눌러 그림에서 텍스트 복사를 사용할 수 있습니다. 파일 인쇄물은 현재 페이지 또는 모든 페이지의 텍스트를 복사하는 선택지가 제공될 수 있습니다.

Microsoft는 이미지의 복잡성, 가독성, 양에 따라 명령이 바로 나타나지 않을 수 있다고 안내합니다. 인식이 진행 중이면 기다린 뒤 다시 확인하고, 결과를 붙여넣은 후 원본과 대조합니다.

8. 휴대폰의 사진 글자 인식

지원되는 iPhone과 iPad에서는 라이브 텍스트로 사진, 비디오, 온라인 이미지의 글자를 선택하고 복사하거나 번역할 수 있습니다. 카메라로 문서를 비춘 상태에서도 인식 기능을 사용할 수 있습니다.

전화번호나 이메일이 자동 동작으로 연결될 수 있으므로 잘못 인식된 번호를 바로 누르지 마세요. 연락하거나 링크를 열기 전에 원본의 숫자와 주소를 한 글자씩 비교합니다.

9. 한국어와 영문이 섞인 문서

언어 자동 감지가 있어도 한글과 영문, 숫자, 특수기호가 섞이면 비슷한 모양의 문자를 바꿔 읽을 수 있습니다. 영문 O와 숫자 0, 대문자 I와 소문자 l, 숫자 1을 특히 확인하세요.

제품 코드와 계좌번호처럼 한 글자 오류가 큰 영향을 주는 항목은 두 번 확인합니다. 가능하면 체크섬, 자리 수, 공식 조회 결과처럼 별도의 검증 기준도 사용하세요.

10. 표와 여러 열 문서

OCR은 글자를 읽어도 표의 셀 구조나 신문식 여러 열의 순서를 잘못 해석할 수 있습니다. 위아래 문장이 섞이거나 열 사이를 건너뛰는지 결과 전체를 읽어봅니다.

표는 행과 열 머리글을 따로 추출하고, 값은 원본 셀 위치에 맞게 다시 배치하는 편이 안전합니다. 합계를 계산할 자료라면 행 수와 열 합계를 원본과 비교합니다.

11. 손글씨와 장식 글꼴

손글씨는 사람마다 획과 간격이 달라 인쇄 글자보다 인식률이 낮을 수 있습니다. OneNote에는 지원 환경에서 필기 내용을 텍스트로 바꾸는 별도 기능도 있지만 언어와 글씨 상태에 따라 결과가 달라집니다.

장식 글꼴, 세로쓰기, 곡선 글자, 배경 위 흰 글자는 오인식 가능성이 큽니다. 중요한 문장은 직접 입력하고 두 사람이 교차 확인하는 방법도 고려하세요.

12. 개인정보가 있는 문서

신분증, 의료 기록, 계약서, 계좌 정보처럼 민감한 파일을 온라인 서비스에 올리기 전 저장·처리 정책과 계정 상태를 확인해야 합니다. 필요 없는 부분은 업로드 전 안전한 사본에서 제거하세요.

공용 컴퓨터에서는 자동 로그인, 최근 파일, 휴지통과 다운로드 폴더에 원본이나 결과가 남을 수 있습니다. 허용된 기기와 저장소만 사용하고 작업 뒤 파일 보관 기준을 따릅니다.

13. OCR 결과 교정 순서

먼저 페이지 수와 문단 순서를 확인하고, 다음으로 제목·표·목록 구조를 맞춥니다. 그 뒤 숫자, 날짜, 금액, 고유명사, URL처럼 오류 영향이 큰 항목을 집중적으로 대조합니다.

맞춤법 검사기는 자연스럽지 않은 문장을 찾는 데 도움을 줄 수 있지만 원문과 다른 단어를 자동으로 올바르게 복원하지는 않습니다. 최종 판단 기준은 원본 이미지입니다.

14. 검수 체크리스트

  1. 문서 방향과 원근을 바로잡습니다.
  2. 글자 위의 반사와 그림자를 제거합니다.
  3. 작은 글자는 구역별로 가까이 촬영합니다.
  4. 지원 형식과 파일 크기를 확인합니다.
  5. 페이지와 문단 순서를 원본과 비교합니다.
  6. 숫자·날짜·고유명사를 한 글자씩 대조합니다.
  7. 민감 파일의 저장 위치와 삭제 기준을 확인합니다.

결과 품질 확인표

  • 모든 페이지가 포함됐습니다.
  • 열과 표의 읽기 순서가 맞습니다.
  • 0/O, 1/I/l 혼동을 확인했습니다.
  • 금액과 소수점이 원문과 같습니다.
  • 링크와 이메일 주소를 직접 비교했습니다.
  • 자동 교정 뒤 뜻이 바뀌지 않았습니다.
  • 원본을 필요한 기간 동안 보존했습니다.

자주 묻는 질문

OCR은 무엇의 약자인가요?

Optical Character Recognition, 즉 광학 문자 인식을 뜻합니다.

사진만 있으면 글자를 완벽하게 추출할 수 있나요?

아닙니다. 이미지 품질과 글꼴, 문서 구조에 따라 오류가 생기므로 원본 대조가 필요합니다.

Google Drive에서 PDF를 텍스트로 바꿀 수 있나요?

지원되는 PDF나 이미지 파일을 Google Docs로 열어 변환하는 방법이 공식 안내돼 있습니다.

OneNote에서 그림 글자를 복사할 수 있나요?

데스크톱 앱에서 그림이나 파일 인쇄물의 텍스트 복사 기능을 사용할 수 있습니다.

표가 흐트러지는 이유는 무엇인가요?

OCR이 글자는 인식해도 행·열과 병합 구조를 그대로 보존하지 못할 수 있기 때문입니다.

숫자 오인식을 어떻게 찾나요?

자리 수, 합계, 원본 이미지, 공식 조회값을 이용해 0과 O 같은 유사 문자를 비교합니다.

민감한 문서를 온라인 OCR에 올려도 되나요?

서비스의 저장·처리 정책과 조직 규정을 확인하고, 필요 없는 정보는 사전에 제거해야 합니다.

공식 출처

여러 파일을 처리할 때의 기준

문서가 많다면 파일명을 페이지 순서와 자료 종류가 드러나게 정리한 뒤 작은 묶음부터 변환하세요. 첫 묶음의 오류 유형을 확인해 촬영 방식이나 교정 규칙을 조정한 다음 나머지 파일에 같은 기준을 적용합니다. 서로 다른 언어와 표 형식이 섞인 자료는 폴더를 나눠야 누락을 찾기 쉽습니다.

결과 파일에는 원본 파일명이나 페이지 번호를 남겨 언제든 근거 이미지로 돌아갈 수 있게 합니다. 수정한 글자는 변경 표시나 검수 기록으로 구분하고, 최종본을 만들기 전 원본 수와 결과 수가 같은지 확인하세요.

마무리

OCR은 다시 입력하는 시간을 줄여주지만 원본의 의미를 보증하는 기능은 아닙니다. 정면 촬영, 충분한 글자 크기, 고른 조명으로 입력 품질을 높이고 변환 뒤 숫자·날짜·표 구조를 우선 검수하세요. 민감 문서는 허용된 환경에서 처리하고 원본과 교정본을 구분해 보관해야 합니다.