본문으로 바로가기
PicsSizer.com Logo

PDF 텍스트 추출기

스캔된 페이지까지 포함해 PDF에서 깔끔하고 편집 가능한 텍스트를 얻으세요. 복사하거나 .txt 파일로 저장할 수 있습니다.

스캔 페이지 인식 (OCR)18개 OCR 언어깔끔한 단락 정리PDF 최대 20개 동시 처리.txt로 복사 또는 저장
PDF는 사용자의 기기에만 저장됩니다무료, 가입 불필요일일 제한이나 페이지 제한 없음

일부 PDF에서 텍스트를 복사할 수 없는 이유는 무엇인가요?

일부 PDF는 텍스트 자체가 아니라 텍스트가 담긴 이미지를 포함하고 있습니다. 스캔된 페이지는 그저 이미지일 뿐이라서 선택하거나 복사할 것이 없습니다. 이 변환기는 PDF에서 실제 텍스트를 OCR 없이 곧바로 읽어와 빠르고 정확하게 처리합니다. 이미지로 된 페이지에서만 OCR을 실행합니다.

사람들이 PDF 텍스트 추출을 활용하는 방법

업무

  • 계약서나 스캔된 편지에서 조항을 복사하기
  • PDF로 저장된 보고서나 슬라이드의 텍스트를 재사용하기
  • 청구서나 은행 명세서에서 세부 정보 추출하기
  • 텍스트를 문서나 스프레드시트 앱에 붙여넣어 편집하기

학업 및 연구

  • 논문을 다시 입력하지 않고 인용하기
  • 스캔한 책 페이지를 검색 가능한 노트로 바꾸기
  • 강의 슬라이드와 유인물에서 텍스트 추출하기
  • 여러 PDF에서 인용문을 한 번에 모으기

일상 활용

  • PDF를 AI 챗봇에 붙여넣어 요약하거나 질문하기
  • 선택이 막혀 있는 PDF에서 텍스트 복사하기
  • 텍스트를 번역기에 붙여넣기
  • 매뉴얼, 서식, 레시피를 일반 텍스트 파일로 저장하기

PDF를 텍스트로 변환하는 방법

  1. 1

    PDF 추가하기

    이 페이지 상단의 상자에 PDF를 드래그하거나 클릭해서 선택하세요. 최대 20개까지 한 번에 추가할 수 있습니다.

  2. 2

    페이지 읽기

    실제 텍스트가 있는 페이지는 즉시 읽힙니다. 스캔된 페이지는 자동으로 감지되어 선택한 언어로 OCR 처리됩니다. 모드를 따로 전환할 필요가 없습니다.

  3. 3

    복사 또는 다운로드

    원하는 대로 텍스트를 편집한 뒤 복사하거나 .txt 파일로 저장하세요. PDF가 여러 개인 경우 하나의 .txt 파일이나 ZIP으로 전체를 다운로드할 수 있습니다.

OCR로 스캔된 PDF를 텍스트로 변환하기

스캔된 PDF는 각 페이지가 이미지 형태이므로 텍스트를 OCR(광학 문자 인식)로 읽어야 합니다. 이 변환기는 모든 페이지를 자동으로 확인해 스캔된 페이지를 OCR로 읽어줍니다.

  • 각 페이지는 텍스트, OCR, 빈 페이지로 표시되어 어떤 페이지가 스캔됐는지 확인할 수 있습니다.
  • 복사 시 상자나 이상한 기호로 나오는 페이지는 스캔으로 간주되어 OCR로 처리됩니다.
  • 스캔된 페이지는 선택한 언어로 읽힙니다. 18개 언어 중 최대 3개까지 동시에 선택할 수 있습니다.
  • 페이지 텍스트가 이상하게 보이면 페이지 번호를 클릭하고 'OCR로 읽기'를 선택해 스캔으로 다시 읽으세요.

혼합된 PDF도 처리됩니다. 타이핑된 페이지와 스캔된 페이지가 페이지 순서대로 하나의 텍스트로 합쳐집니다.

PDF가 아니라 사진이나 스크린샷이 있으신가요? 이미지 텍스트 추출기로 텍스트를 얻으세요.

줄바꿈 없이 PDF에서 텍스트 복사하기

PDF에서 복사한 텍스트는 대개 줄이 끝날 때마다 줄바꿈이 생깁니다. '줄을 단락으로 합치기' 기능은 줄바꿈된 문장을 다시 이어붙여 문서, 이메일, AI 챗봇 등에 깔끔하게 붙여넣을 수 있게 해줍니다. 기본적으로 활성화되어 있습니다.

이 정리 기능은 PDF 텍스트를 지저분하게 만드는 다른 문제도 함께 해결합니다:

  • 줄 끝에서 하이픈으로 나뉜 단어는 하나로 다시 합쳐집니다.
  • 제목, 목록 항목, 표의 행은 각자 별도의 줄로 유지됩니다.
  • '머리글, 바닥글, 페이지 번호 제거' 기능은 페이지마다 반복되는 머리글, 바닥글, 페이지 번호를 삭제합니다. 기본적으로 활성화되어 있습니다.
  • --- Page 3 --- 같은 페이지 표시는 각 페이지의 시작 위치를 알려줍니다. 하나의 깔끔한 텍스트 블록을 원하면 이 기능을 끄세요.

각 옵션은 PDF를 다시 읽지 않고도 즉시 텍스트를 갱신합니다. '줄을 단락으로 합치기'를 끄면 PDF에 있는 줄바꿈이 그대로 유지됩니다.

무료, 프라이버시 보장, 무제한

이 PDF 텍스트 추출기는 무료이며 가입도 계정도 필요 없습니다. 그 외에도 다음과 같은 장점이 있습니다:

  • 프라이버시 보장. PDF는 사용자의 기기에만 남아 있습니다. 휴대폰이나 컴퓨터에서 바로 열리고 읽히며, 파일이 서버로 전송되는 일은 없습니다.
  • 페이지 제한도 일일 제한도 없습니다. PDF 하나당 최대 100MB까지 가능하고, 한 번에 최대 20개까지 추가할 수 있습니다.
  • 잠긴 파일도 안전하게 처리됩니다. 비밀번호로 보호된 PDF는 사용자의 기기에서 비밀번호를 입력해 열리며, 비밀번호는 저장되지 않습니다.

스캔된 페이지를 처음 읽을 때 OCR 리더가 한 번 다운로드됩니다(영어 기준 약 4MB). 브라우저에 저장되므로 이후 스캔은 더 빠르게 시작됩니다. 실제 텍스트만 있는 PDF는 이 과정이 필요 없습니다.

PDF에서 텍스트를 추출하는 가장 좋은 방법은 무엇인가요?

PDF가 이미 가지고 있는 텍스트를 그대로 읽고, 스캔된 페이지에만 올바른 언어로 OCR을 사용하는 것입니다. 그러면 타이핑된 페이지는 정확하게 유지되고, 스캔된 페이지도 최대한 정확하게 처리됩니다. 이 도구는 페이지별로 이 선택을 자동으로 해줍니다.

더 깔끔한 텍스트를 얻으려면 다음을 참고하세요:

  • 올바른 OCR 언어를 선택하세요. 예를 들어 독일어를 영어로 읽으면 움라우트가 사라집니다.
  • 언어가 섞인 스캔 문서라면 최대 3개 언어를 선택하세요.
  • 선명하고 곧은 스캔본을 사용하세요. 흐리거나 기울어진 페이지는 오류가 더 많습니다.
  • 페이지가 뒤죽박죽으로 나오면 페이지 번호를 클릭하고 'OCR로 읽기'를 선택하세요.
  • 스캔된 페이지의 이름, 숫자, 이메일 주소는 꼭 확인하세요. 가장 오인식되기 쉬운 부분입니다.

PDF를 OCR 처리하는 데 얼마나 걸리나요? 실제 텍스트가 있는 페이지는 긴 PDF라도 거의 즉시 읽힙니다. 스캔된 페이지는 각각 몇 초씩 걸리며, 진행 상황을 확인하거나 언제든 중지할 수 있습니다.

OCR은 인쇄된 텍스트에 최적화되어 있습니다. 손글씨나 품질이 낮은 스캔본은 오류가 자주 발생합니다. 잡지나 서식처럼 복잡한 레이아웃은 순서가 뒤섞여 나올 수도 있으니 사용 전에 텍스트를 확인하세요.

자주 묻는 질문

스캔 페이지, 언어, 제한, 프라이버시

궁금한 점이 더 있으신가요? 고객 지원팀에 문의하세요.