Como converter PDF em TXT
Às vezes a formatação é exatamente aquilo que não quer. Dar um documento a um script, a uma ferramenta de tradução, a um índice de pesquisa ou a um modelo de linguagem corre muito melhor quando a entrada é texto limpo em vez de uma paginação cheia de colunas, cabeçalhos e rodapés.
Converter um PDF em TXT tira tudo menos as palavras. Este guia cobre a extração, o aspeto do resultado consoante o tipo de documento, e a única situação em que não devolve absolutamente nada: os ficheiros digitalizados.
Quer fazer já? Abra PDF para TXT e receba o ficheiro em poucos segundos.
Abrir a ferramentaQuando precisa de PDF para TXT
- Passar o conteúdo de um documento a um script, a um índice de pesquisa ou a uma cadeia de análise.
- Preparar texto para uma ferramenta de tradução ou um modelo de linguagem, que funcionam melhor sem ruído de paginação.
- Copiar passagens longas de um documento sem lutar com a seleção do visualizador de PDF.
Converter PDF em TXT passo a passo
Confirme que o PDF tem texto a sério
Tente selecionar uma frase num visualizador de PDF. Se a seleção realçar palavras, há uma camada de texto para extrair. Se nada selecionar, o ficheiro é uma digitalização e precisa de OCR.
Abra a ferramenta PDF para TXT
Vá à página PDF para TXT. A extração corre no navegador, sem instalação e sem conta.
Carregue o documento
Arraste o PDF para a área de carregamento ou selecione-o na caixa de diálogo. Ficheiros protegidos por palavra-passe têm de ser desbloqueados primeiro.
Extraia
Inicie o processo e aguarde um instante. A camada de texto é lida do documento e escrita num ficheiro de texto simples.
Descarregue e limpe
Descarregue o TXT e abra-o em qualquer editor. Cabeçalhos repetidos, números de página e hifenização no fim das linhas são os restos habituais, e duas passagens de localizar-e-substituir tratam disso.
Problemas comuns e como resolvê-los
O ficheiro de saída está vazio
O PDF contém imagens de texto e não texto — uma digitalização ou um documento fotografado. Só o OCR consegue produzir caracteres a partir de píxeis; a conversão de formato não tem nada para extrair.
O texto das colunas vem entrelaçado
A ordem de leitura numa paginação de várias colunas depende de como o documento foi construído, e as colunas podem acabar a alternar linha a linha. Separar as colunas num editor de texto costuma ser mais rápido do que qualquer correção automática.
As palavras vêm partidas com hífenes
A hifenização das mudanças de linha é preservada literalmente. Um localizar-e-substituir por hífen seguido de mudança de linha volta a juntar as palavras numa só operação.
TXT ou Word: que extração escolher
Escolha TXT quando só quer as palavras. É a entrada mais limpa possível para scripts, indexação, tradução e análise, e nunca leva formatação perdida para o que a consome.
Escolha PDF para Word quando tenciona reescrever e voltar a publicar o documento. Essa conversão tenta manter títulos, estilos, tabelas e imagens, dando-lhe algo para editar em vez de algo para processar. Pergunte-se se o próximo leitor é uma máquina ou uma pessoa, e escolha em conformidade.
Perguntas frequentes
Porque é que o ficheiro extraído está vazio?
O PDF é uma imagem digitalizada sem camada de texto. Passe-o por software de OCR para criar uma e depois extraia.
Mantém-se alguma formatação?
Não, e é essa a ideia. Recebe os caracteres e as mudanças de linha, sem tipos de letra, estilos, colunas ou imagens.
Qual é a codificação do resultado?
UTF-8, para que todos os alfabetos e caracteres acentuados fiquem corretamente preservados.
As imagens e as tabelas são extraídas?
As imagens não. O conteúdo das tabelas sai como texto, mas a estrutura de linhas e colunas não se mantém.
Posso extrair texto de um PDF protegido?
Retire primeiro a proteção com a ferramenta Desbloquear PDF e depois faça a extração.
Há limite de tamanho do documento?
Até 100 MB por ficheiro, sem limite diário, sem registo e sem marca de água.
Quer fazer já? Abra PDF para TXT e receba o ficheiro em poucos segundos.
Abrir a ferramenta