본문으로 건너뛰기

PDF OCR: 스캔 PDF 텍스트 추출

xFormat.space는 스캔한 PDF의 각 페이지를 렌더링하고 기기 안의 인식 모델로 읽어서 브라우저 안에서 OCR을 하기 때문에, 문서를 업로드하지 않고 페이지별 텍스트를 얻을 수 있어요.

브라우저에서 실행돼요. 파일은 내 기기 밖으로 나가지 않아요.

사용 방법

PDF에서 글자를 선택하거나 복사할 수 없다면 아마 스캔본, 즉 페이지를 찍은 그림일 거예요. 이 도구는 각 페이지를 렌더링하고, 그 위의 글자를 내 기기에서 인식해서 복사하거나 저장할 수 있는 일반 텍스트로 돌려드려요. PDF는 컴퓨터를 떠나지 않아요.

  1. 1

    스캔한 PDF를 페이지에 끌어다 놓고 OCR을 여세요.

  2. 2

    문서의 언어를 고르세요.

  3. 3

    인식 시작을 누르고 모든 페이지가 끝날 때까지 기다린 뒤, 텍스트를 복사하거나 TXT 파일로 다운로드하세요.

얻을 수 있는 것과 없는 것

결과는 일반 텍스트이고, 각 페이지가 "--- Page N ---" 줄로 구분되며 신뢰도와 텍스트 영역 수가 함께 표시돼요. 검색 가능한 PDF는 아니에요. 도구가 파일에 숨은 텍스트 레이어를 다시 써 넣지 않아서 원본 PDF는 그대로 남아요. PDF에서 이미 텍스트를 선택할 수 있다면 OCR이 필요 없어요. 그냥 복사하세요.

스캔 PDF 인식 정확도 팁

인식 전에 페이지를 2배 크기로 렌더링하므로 스캔 품질이 정확도의 상한이에요. 약 300 dpi로 똑바로, 대비가 높게 스캔한 문서가 비뚤어지거나 회색이거나 해상도가 낮은 스캔보다 훨씬 잘 읽혀요. 언어를 맞게 고르세요. 중국어·영어, 영어, 일본어, 한국어, 프랑스어, 독일어는 각각 별도 선택지이고 한 번에 하나만 쓸 수 있어요. 표, 단, 각주는 텍스트 줄로 읽혀서 레이아웃이 유지되지 않으니 순서를 정리해야 할 수 있어요.

처리는 내 기기에서 한 페이지씩 이루어져서 긴 문서는 시간이 걸리고, 얼마나 걸릴지는 기기 성능과 페이지 수에 달려 있어요. 끝날 때까지 탭을 열어 두세요. 처음 실행할 때 약 15 MB 모델을 내려받고 이후에는 캐시돼요. 이름, 숫자, 중요한 내용은 다시 확인하세요.

자주 묻는 질문

스캔한 PDF에서 텍스트를 추출하려면 어떻게 하나요?

PDF를 페이지에 놓고 문서 언어를 고른 뒤 인식 시작을 누르세요. xFormat.space가 페이지별로 텍스트를 보여 주고, 복사하거나 TXT 파일로 받을 수 있어요.

검색 가능한 PDF를 만들어 주나요?

아니요. 일반 텍스트만 출력하고 PDF에 텍스트 레이어를 추가하지 않아요. 원본 파일은 바뀌지 않아요.

스캔 PDF가 서버에 업로드되나요?

아니요. 페이지 렌더링과 인식이 브라우저에서 이루어져요. 처음에 약 15 MB 문자 인식 모델만 내려받고, PDF는 내 기기에 남아요.

PDF OCR은 어떤 언어를 지원하나요?

중국어·영어(번체 중국어 포함), 영어, 일본어, 한국어, 프랑스어, 독일어이고, 한 번에 하나씩이에요.

OCR 결과가 부정확해요. 왜 그런가요?

대부분 스캔 때문이에요. 해상도가 낮거나, 페이지가 비뚤어졌거나, 그림자가 있거나, 언어가 틀린 경우예요. 약 300 dpi의 선명한 스캔을 쓰고, 언어가 맞는지 확인하고, 결과를 다시 읽어 보세요.