
PDF에서 글자(텍스트) 추출하는 법
PDF 안의 텍스트를 복사하거나 따로 저장해야 할 때가 있습니다. 텍스트가 있는 PDF와 스캔한 이미지 PDF, 두 경우 모두 브라우저에서 처리하는 방법을 정리했습니다.
8분 분량
글자만 뽑기 · PDF → 텍스트
PDF 본문 글자를 뽑아 복사하거나 .txt로 저장합니다. 스캔본은 OCR로 바로 추출합니다.
개인정보 유출 걱정 없는 로컬 처리
파일은 사용자의 기기 외부로 전송되지 않습니다.
서버 업로드나 대기 시간이 전혀 없으며, 모든 작업은 브라우저 내에서 안전하게 직접 완결됩니다. 안심하고 사용하세요.
이렇게 쓰세요
문서 불러오기
PDF를 올리면 브라우저가 모든 페이지에서 텍스트를 뽑습니다.
파일을 끌어다 놓거나 클릭해서 선택하세요.
원본 파일
아직 선택된 문서가 없습니다.
출력
추출된 텍스트는 일반 텍스트입니다. 복사하거나 텍스트 파일(.txt)로 저장하세요.
글자만 뽑아내기
전체 문서가 아닌 본문 텍스트 데이터만 필요한 경우가 있습니다. 인용할 문단이나 번역할 단락, 분석할 보고서 텍스트 등이 대표적입니다. PDFTasker는 PDF의 텍스트 레이어를 브라우저 내에서 읽어내어 간편하게 복사하거나 .txt 파일로 저장할 수 있도록 추출해 줍니다. 파일은 서버에 업로드되지 않으므로 개인정보가 포함된 민감한 보고서나 문서도 안심하고 텍스트만 안전하게 가져올 수 있습니다.
프라이버시와 신뢰
텍스트 추출은 그냥 읽기만 하는 작업입니다. 브라우저가 PDF를 화면에 띄울 때 하는 바로 그 일이라, 파일을 서버로 보낼 이유가 없습니다. PDFTasker는 텍스트 레이어를 기기 안에서 파싱해 몇 초 만에 일반 텍스트로 돌려줍니다. 스캔본은 읽을 텍스트 레이어가 없어 OCR이 필요하고, 실제 글자가 있는 문서는 모두 기기 안에서 끝납니다.
사용 가이드
자주 묻는 질문
브라우저가 PDF를 화면에 띄울 때 쓰는 엔진으로, 대부분의 PDF가 화면 뒤에 담고 있는 텍스트 레이어를 읽습니다. 사이트가 한 번 열리면 전부 기기 안에서 처리되어 문서가 업로드되지 않습니다. 대부분의 문서는 몇 초 안에 텍스트가 나오고, 복사하거나 .txt로 저장할 수 있습니다.
아무것도 안 나오면 그 PDF는 대부분 스캔본입니다. 글자 레이어 없이 페이지를 찍은 이미지인 거죠. 추출은 파일 안에 실제로 저장된 글자만 읽을 수 있습니다. 이런 스캔본은 결과가 비면 화면에 'OCR로 텍스트 추출' 버튼이 떠서, 페이지 이미지에서 글자를 직접 읽어냅니다(영어·한국어, 기기 안에서 처리).
안 올라갑니다. PDF는 브라우저 안에서 읽히고 추출된 텍스트도 기기 밖으로 나가지 않습니다. 텍스트를 뽑는 문서는 계약서, 보고서, 명세서처럼 비공개로 둘 만한 게 많아서 이 점이 중요합니다. 끝나면 탭을 닫는 것으로 충분하고, 서버에 남는 게 없습니다.
줄바꿈이 있는 읽기 좋은 텍스트가 나오지만, 단 나누기·표·머리말·글꼴 같은 레이아웃은 그대로 살리지 못합니다. 2단 편집 페이지는 순서가 뒤섞여 읽힐 수 있고, 표는 한 줄로 풀어져 나옵니다. 그냥 읽거나 검색하거나 다른 곳에 붙여 넣기엔 충분하지만, 정확한 레이아웃이 필요하면 원본 PDF를 쓰세요.
됩니다. PDF에 실제 텍스트 레이어가 있으면 언어는 상관없습니다. 한국어, 영어, 숫자, 섞인 내용 모두 똑같이 추출됩니다. 글자 레이어가 없는 스캔 이미지만 일반 추출이 안 되는데, 이 경우는 내장 OCR 폴백이 영어·한국어를 함께 인식해 처리합니다.
PDFTasker Blog
이 사이트는 광고 서비스 제공을 위해 쿠키를 사용합니다. 파일 처리는 브라우저 내에서만 이루어집니다. 쿠키 정책