스캔 PDF OCR
텍스트 레이어가 없는 스캔·이미지 PDF에서 글자를 인식해 뽑아냅니다 · 브라우저 처리
1. PDF 선택
2. 언어
인식 언어
언어 데이터는 첫 사용 때 한 번 내려받아 브라우저에 캐시됩니다. 파일은 서버로 전송되지 않습니다.
3. 실행
텍스트 레이어가 없는 스캔·이미지 PDF에서 글자를 인식해 뽑아냅니다. 각 페이지를 이미지로 만든 뒤 tesseract.js로 인식하며, 파일은 서버로 전송되지 않습니다.
이런 걸 할 수 있어요
- ✓스캔·사진 PDF에서 텍스트 추출
- ✓한국어+영어·영어·일본어·중국어 인식
- ✓인식 결과를 화면에서 보고 복사·TXT 저장
- ✓여러 페이지 일괄 처리(앞 30장)
- ✓브라우저 내 처리 — 업로드 없음
이렇게 쓰세요
- 1스캔 PDF를 올립니다
- 2인식 언어를 고르고 '텍스트 인식'을 누릅니다
- 3결과를 복사하거나 TXT로 내려받습니다
지원 형식 · PDF(입력) → 텍스트/TXT
글자가 이미지로만 된 스캔 PDF에서 글자를 인식(OCR)해 복사·검색할 수 있는 텍스트로 뽑아냅니다. 처리는 서버 없이 브라우저 안에서 이뤄집니다.
사용 방법
- 1스캔한 PDF 파일을 끌어다 놓거나 선택합니다.
- 2인식할 언어 등 옵션을 정하고 실행합니다.
- 3인식된 텍스트 결과를 받습니다.
이럴 때 유용해요
예를 들면 스캔한 논문에서 인용할 문단을 복사해 옮겨 써야 할 때 유용합니다.
이미지로만 된 계약서를 검색·복사 가능한 텍스트로 만들고 싶을 때도 좋습니다.
이미지 속 글자를 읽어내요
페이지를 이미지로 분석해 글자를 인식합니다. 스캔 품질이 좋고 인쇄체일수록 정확하고, 흐릿하거나 손글씨인 경우에는 오차가 있을 수 있습니다.
파일은 기기 안에서 처리돼요
PDF는 서버로 전송되지 않고 브라우저 안에서 인식됩니다. 민감한 문서도 안심하고 다룰 수 있습니다.
자주 묻는 질문
파일이 서버에 올라가나요?+
아니요. 인식은 브라우저 안에서 처리되어 문서가 기기를 떠나지 않습니다.
인식 정확도는 어떤가요?+
선명한 인쇄체 스캔일수록 정확합니다. 흐릿하거나 손글씨인 경우에는 오차가 생길 수 있어 결과 확인이 필요합니다.
어떤 언어를 인식하나요?+
옵션에서 인식할 언어를 골라 처리할 수 있습니다.