PDF naar TXT omzetten
Soms is de opmaak juist het laatste wat u wilt. Een document aan een script, een vertaalhulpmiddel, een zoekindex of een taalmodel voeren gaat veel beter met schone tekst dan met een pagina-indeling vol kolommen, kop- en voetteksten.
Een PDF naar TXT omzetten strookt alles weg behalve de woorden. Deze gids behandelt de extractie, hoe de uitvoer er bij verschillende soorten documenten uitziet, en de ene situatie waarin er helemaal niets uitkomt: gescande bestanden.
Meteen aan de slag? Open PDF naar TXT en haal je bestand binnen enkele seconden op.
Open het hulpmiddelWanneer u PDF naar TXT nodig hebt
- Documentinhoud aanleveren aan een script, een zoekindex of een analyseproces.
- Tekst klaarmaken voor een vertaalhulpmiddel of een taalmodel, die het best werken zonder opmaakruis.
- Flinke passages uit een lang document kopiëren zonder te vechten met de selectie van de PDF-lezer.
PDF stap voor stap naar TXT omzetten
Controleer eerst of de PDF echte tekst bevat
Probeer een zin te selecteren in een PDF-lezer. Licht de selectie afzonderlijke woorden op, dan is er een tekstlaag om uit te lezen. Selecteert er niets, dan is het bestand een scan en is OCR nodig.
Open het hulpmiddel PDF naar TXT
Ga naar de pagina PDF naar TXT. De extractie draait in de browser, zonder installatie of account.
Upload het document
Sleep de PDF op het uploadvak of kies hem in het dialoogvenster. Met een wachtwoord beveiligde bestanden moeten eerst worden ontgrendeld.
Haal de tekst eruit
Start het proces en wacht even. De tekstlaag wordt uit het document gelezen en in een plat tekstbestand geschreven.
Download en ruim op
Download de TXT en open hem in een willekeurige editor. Herhaalde kopteksten, paginanummers en afbreekstreepjes aan regeleinden zijn de gebruikelijke restanten, en een paar rondes zoeken-en-vervangen ruimen die op.
Veelvoorkomende problemen en oplossingen
Het uitvoerbestand is leeg
De PDF bevat afbeeldingen van tekst, geen tekst — een scan of een gefotografeerd document. Alleen OCR kan tekens uit pixels halen; formaatomzetting heeft niets te extraheren.
Kolomtekst loopt door elkaar
De leesvolgorde in een meerkoloms opmaak hangt af van hoe het document is opgebouwd, en kolommen kunnen regel voor regel gaan afwisselen. De kolommen in een teksteditor uit elkaar halen gaat meestal sneller dan welke automatische oplossing ook.
Woorden zijn met streepjes afgebroken
Afbreking aan regeleinden wordt letterlijk bewaard. Een zoeken-en-vervangen op streepje-gevolgd-door-nieuwe-regel zet de woorden in één handeling weer aaneen.
TXT of Word: welke extractie kiest u
Kies TXT wanneer u alleen de woorden wilt. Het is de schoonst denkbare invoer voor scripts, indexering, vertaling en analyse, en het sleept nooit rommelige opmaak mee naar wat het verwerkt.
Kies PDF naar Word wanneer u het document wilt herschrijven en opnieuw uitgeven. Die omzetting probeert koppen, stijlen, tabellen en afbeeldingen te behouden, en geeft u iets om te bewerken in plaats van iets om te verwerken. Vraag u af of de volgende lezer een machine of een mens is, en kies daarnaar.
Veelgestelde vragen
Waarom is het geëxtraheerde bestand leeg?
De PDF is een gescande afbeelding zonder tekstlaag. Haal hem door OCR-software om er een te maken en extraheer daarna.
Blijft er opmaak behouden?
Nee, en dat is juist de bedoeling. U krijgt de tekens en de regeleinden, zonder lettertypen, stijlen, kolommen of afbeeldingen.
Welke codering heeft de uitvoer?
UTF-8, zodat elk alfabet en elk accentteken correct behouden blijft.
Worden afbeeldingen en tabellen geëxtraheerd?
Afbeeldingen niet. Tabelinhoud komt als tekst naar buiten, maar de rij- en kolomstructuur blijft niet behouden.
Kan ik tekst uit een beveiligde PDF halen?
Verwijder de beveiliging eerst met PDF ontgrendelen en voer daarna de extractie uit.
Geldt er een limiet voor de documentgrootte?
Tot 100 MB per bestand, zonder daglimiet, zonder registratie en zonder watermerk.
Meteen aan de slag? Open PDF naar TXT en haal je bestand binnen enkele seconden op.
Open het hulpmiddel