PDF를 TXT로 변환하는 방법

서식이야말로 원하지 않는 것일 때가 있습니다. 문서를 스크립트나 번역 도구, 검색 색인, 언어 모델에 넣을 때는, 단과 머리글과 바닥글로 가득한 쪽 배치보다 깨끗한 글을 입력으로 주는 편이 훨씬 낫습니다.

PDF를 TXT로 바꾸면 글자를 뺀 모든 것이 벗겨집니다. 이 가이드는 그 추출 과정과, 문서 종류에 따라 결과가 어떻게 나오는지, 그리고 아무것도 나오지 않는 단 하나의 경우 — 스캔 파일 — 을 다룹니다.

지금 바로 해볼까요? PDF를 TXT로을 열면 몇 초 만에 파일을 받을 수 있습니다.

도구 열기

PDF를 TXT로 바꿔야 할 때

  • 문서 내용을 스크립트나 검색 색인, 분석 공정에 넣을 때.
  • 번역 도구나 언어 모델에 넣을 글을 준비할 때. 둘 다 배치의 잡음이 없을수록 잘 작동합니다.
  • 긴 문서에서 상당한 분량을 옮겨 적고 싶은데 PDF 뷰어의 선택 기능과 씨름하기 싫을 때.

PDF를 TXT로 변환하는 단계

  1. PDF에 진짜 글자가 있는지 먼저 확인하기

    PDF 뷰어에서 문장 하나를 선택해 보세요. 낱말 단위로 강조된다면 뽑아낼 글자 층이 있는 것입니다. 아무것도 선택되지 않으면 그 파일은 스캔본이고 OCR이 필요합니다.

  2. PDF → TXT 도구 열기

    PDF를 TXT로 페이지를 엽니다. 추출은 브라우저에서 이뤄지고 설치도 계정도 없습니다.

  3. 문서 올리기

    PDF를 업로드 영역으로 끌어다 놓거나 대화상자에서 고르세요. 암호가 걸린 파일은 먼저 잠금을 풀어야 합니다.

  4. 뽑아내기

    작업을 시작하고 잠시 기다립니다. 문서에서 글자 층을 읽어 일반 텍스트 파일로 써 냅니다.

  5. 내려받아 다듬기

    TXT를 내려받아 아무 편집기에서나 여세요. 되풀이되는 머리글과 쪽 번호, 줄 끝의 붙임표가 흔히 남는 찌꺼기이고, 찾아 바꾸기 두어 번이면 정리됩니다.

자주 겪는 문제와 해결

결과 파일이 비어 있습니다

그 PDF에는 글자가 아니라 글자의 이미지가 들어 있습니다 — 스캔본이거나 사진으로 찍은 문서지요. 화소에서 글자를 만들어 낼 수 있는 것은 OCR뿐이고, 형식 변환에는 뽑아낼 것이 없습니다.

단으로 나뉜 글이 뒤섞입니다

여러 단 배치에서 읽는 순서는 문서를 어떻게 만들었는지에 달려 있어서, 단이 한 줄씩 번갈아 나올 수 있습니다. 텍스트 편집기에서 단을 갈라 놓는 편이 어떤 자동 수정보다 대개 빠릅니다.

낱말이 붙임표로 잘려 있습니다

줄 끝의 낱말 나눔이 글자 그대로 남습니다. 붙임표 뒤에 줄바꿈이 오는 형태를 찾아 바꾸면 낱말이 한 번에 다시 이어집니다.

TXT와 Word, 어느 쪽으로 뽑을까

원하는 것이 글자뿐이라면 TXT를 고르세요. 스크립트와 색인, 번역, 분석에 이보다 깨끗한 입력은 없으며, 그것을 받아 쓰는 쪽으로 엉뚱한 서식을 끌고 들어가지도 않습니다.

문서를 다시 쓰고 다시 펴낼 생각이라면 PDF를 Word로 고르세요. 그 변환은 제목과 서식, 표, 이미지를 지키려 하므로, 처리할 재료가 아니라 편집할 재료를 손에 쥐게 됩니다. 다음 독자가 기계인지 사람인지 자문한 뒤 고르면 됩니다.

자주 묻는 질문

뽑아낸 파일이 왜 비어 있나요?

그 PDF가 글자 층 없는 스캔 이미지이기 때문입니다. OCR 소프트웨어로 층을 만든 다음 뽑아내세요.

서식이 조금이라도 남나요?

남지 않고, 그게 요점입니다. 글자와 줄바꿈만 얻고 글꼴, 서식, 단, 이미지는 없습니다.

결과의 인코딩은 무엇인가요?

UTF-8이라 모든 문자 체계와 악센트 글자가 올바르게 보존됩니다.

이미지와 표도 뽑히나요?

이미지는 아닙니다. 표의 내용은 글로 나오지만 행과 열의 구조는 보존되지 않습니다.

보호된 PDF에서도 글을 뽑을 수 있나요?

PDF 잠금 해제 도구로 보호를 먼저 없앤 뒤 추출을 실행하세요.

문서 크기 제한이 있나요?

파일당 100MB까지이며 하루 제한도, 가입도, 워터마크도 없습니다.

지금 바로 해볼까요? PDF를 TXT로을 열면 몇 초 만에 파일을 받을 수 있습니다.

도구 열기

관련 가이드

전체 가이드