CanDoYa
NL

PDF naar tekst converteren

Draait volledig in je browser - niets uploaden, geen account.

Kies een digitale PDF om de selecteerbare tekst te extraheren.

Deel deze tool

Hoe zet ik een PDF naar tekst om?

Gebruik deze PDF naar tekst converter om de selecteerbare tekst uit een digitale PDF te halen en die daarna te kopiëren of als TXT-bestand te downloaden. De verwerking gebeurt in je browser, dus het document wordt niet geüpload. Gescande PDF's met alleen afbeeldingen hebben OCR nodig, en deze tool voert geen OCR uit.

Zo werkt het

  1. 1Kies een digitale PDF. Sleep één PDF naar de tool of kies hem vanaf je apparaat. Voor het beste resultaat moet je in je gewone PDF-viewer woorden kunnen selecteren.
  2. 2Extraheer de tekstlaag. Klik op Tekst extraheren. PDF.js leest elke pagina lokaal en toont de voortgang zonder het bestand naar een server te sturen.
  3. 3Controleer de platte tekst. Vergelijk alinea's, kolommen, tabellen en symbolen met het origineel. De leesvolgorde in een PDF kan afwijken van de visuele volgorde op de pagina.
  4. 4Kopieer of download. Bewerk het resultaat indien nodig, kopieer het naar het klembord of sla het op als een UTF-8 TXT-bestand.

Voor wie

Deze converter gebruikt Mozilla PDF.js om de bestaande tekstlaag van elke pagina lokaal op je apparaat te lezen. De paginavolgorde en de gerapporteerde regeleindes blijven behouden, waarna je één bewerkbaar resultaat in platte tekst krijgt. Afbeeldingen, lettertypen, kolommen, tabellen en visuele opmaak blijven niet behouden in de TXT-uitvoer.

Er is een belangrijk onderscheid: een digitale PDF bevat tekens die software kan selecteren en doorzoeken. Een scan kan alleen een foto van een pagina bevatten. Het eerste soort uitlezen is tekst parsen; het tweede lezen vereist optical character recognition. Deze tool doet alleen het eerste.

Veelgestelde vragen

Worden mijn PDF-bestanden geüpload naar een server?

Nee. Je browser leest de gekozen PDF lokaal met PDF.js, en het bestand wordt niet naar CanDoYa gestuurd. De code van de PDF-engine kan wel downloaden wanneer je de tool voor het eerst gebruikt, maar jouw document maakt geen deel uit van dat verzoek.

Is deze PDF naar tekst converter gratis?

Ja. Je kunt tekst extraheren, bewerken, kopiëren en downloaden zonder account, watermerk of betaling. Het werk draait op je eigen apparaat, dus er is geen serverwachtrij en ook geen geüpload bestand dat je later moet ophalen.

Wat zijn de limieten voor PDF-grootte en aantal pagina's?

De tool accepteert één PDF tot 100 MB en 2.000 pagina's. Beschikbaar geheugen en de snelheid van je apparaat kunnen een lagere praktische limiet geven, vooral op telefoons. Splits een heel groot document in kleinere PDF's als de browser het niet kan afronden.

Kan deze tool tekst uit een gescande PDF halen?

Niet wanneer de scan alleen uit pagina-afbeeldingen bestaat. Deze converter leest bestaande selecteerbare tekst en voert geen OCR uit. Een gescande PDF heeft een OCR-tool nodig die tekens uit pixels herkent. Sommige gemengde PDF's bevatten op bepaalde pagina's wel selecteerbare tekst en op andere niet; het resultaat markeert pagina's zonder tekst.

Waarom staat de uitgelezen tekst in de verkeerde volgorde?

PDF-pagina's plaatsen tekstfragmenten op coördinaten en slaan niet altijd een duidelijke alinea- of kolomvolgorde op. PDF.js volgt de tekstelementen en regeleindes van het document, en dat kan afwijken van de visuele leesvolgorde in pagina's met meerdere kolommen, tabellen, kopteksten of complexe formulieren.

Behoudt PDF naar tekst opmaak en afbeeldingen?

Nee. TXT-bestanden bevatten alleen platte tekens, dus lettertypen, kleuren, afbeeldingen, links, kolommen en tabelranden blijven niet behouden. Regeleindes komen uit de tekstlaag van de PDF en moeten na extractie soms nog worden aangepast.

Waarom wordt een met wachtwoord beveiligde PDF geweigerd?

De browser kan een versleuteld document niet lezen zonder wachtwoord. Open de PDF in een vertrouwde viewer, voer het wachtwoord in en sla een ontgrendelde kopie op als je toestemming hebt. Voeg daarna die kopie toe aan de converter.

Welke talen kunnen uit een PDF worden gehaald?

De parser is niet aan één taal gebonden. Hij kan Unicode-tekst in elk schrift teruggeven wanneer de PDF een correcte tekenkaart en selecteerbare tekst bevat. Als een document ontbrekende of eigen fontmappings gebruikt, kunnen gekopieerde tekens nog steeds onvolledig of onjuist zijn.