'PDF 텍스트 추출' 은 PDF 속 글자를 복사하고 편집할 수 있는 텍스트로 꺼내 주는 도구입니다. 페이지마다 자동으로 판단해서, 텍스트 레이어가 있는 페이지는 곧바로 추출하고(즉시, 100% 정확), 스캔된 페이지는 OCR로 인식합니다. 모든 처리는 내 브라우저 안에서 이루어지며 파일은 어떤 서버로도 전송되지 않습니다.
PDF 텍스트 추출 · 텍스트 레이어 + OCR
페이지 상태
TXT
0 자PDF는 내 브라우저에서만 처리되며 서버로 전송되지 않습니다. 계약서, 거래내역서, 진료 기록 같은 문서도 안심하고 사용하세요.
1-10, 3, 1,5,8-12 처럼 입력합니다. 비워 두면 전체를 처리합니다.변환 중에는 왼쪽 페이지 상태 칸의 색이 실시간으로 바뀝니다. 초록색은 그 페이지에 텍스트 레이어가 있어 바로 추출했다는 뜻이고, 주황색은 스캔본이라 OCR을 돌리고 있다는 뜻입니다. 내 PDF가 어떤 종류인지 한눈에 보입니다.
PDF에서 텍스트를 꺼내려면 무조건 OCR이 필요하다고 생각하기 쉽지만 그렇지 않습니다. PDF에는 두 종류가 있습니다.
| 텍스트 레이어 PDF | 스캔본 PDF | |
|---|---|---|
| 출처 | 워드·엑셀 내보내기, 인터넷에서 받은 보고서, 전자 청구서, 전자책 | 복합기 스캔, 휴대폰 촬영 후 PDF 변환, 팩스 |
| 내부에 든 것 | 진짜 문자 데이터 | 이미지 한 장 한 장 |
| 추출 속도 | 즉시, 1초에 수십 페이지 | 페이지당 5–15초 |
| 정확도 | 100% | 이미지 품질에 따라 보통 85–98% |
| 언어 파일 필요 | 불필요 | 필요 (약 5–10 MB) |
어떻게 구분하나요? 가장 간단한 방법은 일반 PDF 뷰어로 열어서 마우스로 글자를 드래그해 보는 것입니다. 선택되면 텍스트 레이어 PDF, 페이지 전체가 통째로 반전되면 스캔본입니다.
이 도구에서는 직접 구분할 필요가 없습니다. 페이지마다 먼저 텍스트 레이어를 시도하고, 안 되면 OCR로 넘어갑니다. 그래서 앞부분은 타이핑된 문서이고 뒤에 스캔한 영수증이 붙은 혼합형 PDF도 그대로 처리됩니다.
| 원하는 것 | 입력 |
|---|---|
| 전체 페이지 | 비워 두기 |
| 1–10페이지 | 1-10 |
| 3페이지만 | 3 |
| 1, 5페이지와 8–12페이지 | 1,5,8-12 |
스캔본은 한 번에 최대 20페이지까지 처리합니다. 인색해서가 아니라, OCR이 브라우저에서 돌아가기 때문에 페이지당 5–15초가 걸리기 때문입니다. 200페이지라면 30분 가까이 걸리고, 그 전에 탭이 시스템에 의해 정리될 가능성이 큽니다. 나눠서(1-20, 21-40) 처리하는 편이 훨씬 안정적입니다. 텍스트 레이어 PDF에는 이 제한이 없습니다.
분명히 '텍스트 레이어가 있는' PDF인데 꺼내 보면 이상한 기호나, 뜻이 전혀 통하지 않는 희귀 한자만 나오는 경우가 있습니다. 도구가 고장 난 것이 아니라 그 PDF 자체에 문제가 있는 것입니다.
PDF에 포함된 글꼴은 ToUnicode라는 대조표가 있어야 글꼴 내부의 글리프 번호를 실제 문자로 되돌릴 수 있습니다. 한국어·중국어 PDF는 이 표가 빠지거나 잘못 들어가는 일이 특히 잦습니다. 오래된 편집 프로그램, 일부 워드 내보내기, 팩스 변환본, 그리고 다른 소프트웨어가 나중에 텍스트 레이어를 '덧붙인' 스캔본에서 흔히 나타납니다. 이 경우 텍스트 레이어는 분명히 존재하지만 내용이 틀린 것입니다.
이 도구는 꺼낸 텍스트가 믿을 만한지 자동으로 검사합니다. 사설 영역 문자, 대체 기호가 많거나 페이지 전체가 희귀 문자뿐이면 그 페이지를 스캔본으로 간주하고 OCR로 전환하며, 끝난 뒤 몇 페이지가 이렇게 처리됐는지 알려 줍니다.
자동 판단으로도 부족하다면 위의 「모드」를 「전부 OCR로 처리」로 바꾸세요. 텍스트 레이어를 완전히 무시하고 모든 페이지를 이미지로 만들어 인식합니다. 훨씬 느리지만(페이지당 5–15초) 문제 있는 파일에는 가장 확실한 방법입니다.
열기 비밀번호가 설정된 PDF라면 비밀번호 입력란이 나타납니다. 입력하면 그대로 진행됩니다. 비밀번호도 파일과 마찬가지로 전 과정 내 기기 안에 머물며 어디로도 전송되지 않습니다.
'복사 금지' 같은 권한 비밀번호(owner password)라면 문서 자체는 열리므로 대개 텍스트를 그대로 추출할 수 있습니다.
이 도구는 PDF를 읽는 데 오픈소스 pdf.js를, OCR에는 Tesseract.js를 사용하며 둘 다 내 브라우저에서 실행됩니다. 파일과 추출된 텍스트는 어떤 서버로도 전송되지 않습니다.
무료 온라인 PDF 도구 대부분은 파일을 자기네 서버에 올려야 처리가 됩니다. 근로계약서, 은행 거래내역서, 진료 기록, 내용증명처럼 민감한 문서를 다룬다면 이 차이가 매우 중요합니다.
완전히 무료이며 가입이 필요 없습니다. 텍스트 레이어가 있는 PDF는 페이지 제한이 없고, 스캔본은 브라우저에서 OCR을 돌려야 하므로 한 번에 최대 20페이지까지이며 나눠서 처리할 수 있습니다.
아닙니다. 이 도구는 pdf.js와 Tesseract.js를 사용하며 모든 처리가 내 브라우저에서 실행됩니다. 파일과 결과 모두 어떤 서버로도 전송되지 않습니다.
PDF에 두 종류가 있기 때문입니다. 텍스트 레이어 PDF는 안에 문자 데이터가 들어 있어 그대로 읽으면 되지만, 스캔본은 이미지만 있어서 페이지마다 OCR을 돌려야 하고 페이지당 5–15초가 걸립니다.
일반 PDF 뷰어로 열어 마우스로 글자를 드래그해 보세요. 선택되면 텍스트 레이어 PDF, 선택되지 않으면 스캔본입니다. 다만 직접 구분할 필요는 없습니다. 이 도구가 페이지마다 자동으로 판단합니다.
「모드」를 「전부 OCR로 처리」로 바꾸면 됩니다. 깨진 글자는 대개 PDF에 포함된 글꼴에 ToUnicode 대조표가 없어 텍스트 레이어 자체가 잘못된 경우이며, 한국어·중국어 PDF에서 특히 흔합니다. 도구가 이를 자동으로 감지해 OCR로 전환하지만, 자동 판단이 충분하지 않을 때는 강제로 전부 OCR을 돌리면 확실합니다.
됩니다. 비밀번호 입력란이 나타나며, 열기 비밀번호를 넣으면 계속 진행됩니다. 비밀번호는 전 과정 내 기기 안에만 머뭅니다.
유지되지 않습니다. 결과는 순수 텍스트(.txt)이며 글꼴, 이미지, 표 선은 남지 않습니다. 다단 편집이나 표는 읽는 순서가 흐트러질 수 있어 추출 후 직접 정리해야 하는 경우가 많습니다.