CanDoYa
DE

PDF in Text umwandeln

Läuft komplett in deinem Browser - kein Upload, keine Anmeldung.

Wählen Sie eine digitale PDF aus, um den auswählbaren Text zu extrahieren.

Dieses Tool teilen

Wie kann ich PDF in Text umwandeln?

Mit diesem PDF-in-Text-Tool extrahieren Sie den bereits im digitalen PDF vorhandenen, auswählbaren Text und können ihn danach kopieren oder als TXT-Datei speichern. Die Verarbeitung läuft in Ihrem Browser, das Dokument wird also nicht hochgeladen. Für gescannte PDFs mit reinen Bildseiten braucht es OCR - dieses Tool führt kein OCR aus.

So funktioniert’s

  1. 1Digitale PDF auswählen. Legen Sie eine PDF per Drag-and-drop ab oder wählen Sie sie von Ihrem Gerät aus. Für das beste Ergebnis sollte sich der Text in Ihrem normalen PDF-Viewer markieren lassen.
  2. 2Textebene extrahieren. Klicken Sie auf Text extrahieren. PDF.js liest die Seiten lokal aus und zeigt den Fortschritt an, ohne die Datei an einen Server zu senden.
  3. 3Klartext prüfen. Vergleichen Sie Absätze, Spalten, Tabellen und Sonderzeichen mit dem Original. Die Lesereihenfolge in PDF kann sich von der sichtbaren Seitenreihenfolge unterscheiden.
  4. 4Kopieren oder herunterladen. Bearbeiten Sie das Ergebnis bei Bedarf, kopieren Sie es in die Zwischenablage oder speichern Sie es als UTF-8-TXT-Datei.

Für wen

Dieser Konverter nutzt Mozilla PDF.js, um die vorhandene Textebene jeder Seite direkt auf Ihrem Gerät zu lesen. Dabei bleiben Seitenreihenfolge und die von der PDF ausgegebenen Zeilenumbrüche erhalten, anschließend erhalten Sie ein bearbeitbares Ergebnis als Klartext. Bilder, Schriftarten, Spalten, Tabellen und visuelle Formatierung werden in der TXT-Ausgabe nicht übernommen.

Wichtig ist die Grenze: Ein digitales PDF enthält Zeichen, die Software markieren und durchsuchen kann. Ein Scan kann dagegen nur ein Foto der Seite enthalten. Das eine auszulesen ist Textanalyse, das andere braucht optische Zeichenerkennung. Dieses Tool macht nur den ersten Teil.

Häufige Fragen

Werden meine PDF-Dateien auf einen Server hochgeladen?

Nein. Ihr Browser liest die ausgewählte PDF lokal mit PDF.js, und die Datei wird nicht an CanDoYa gesendet. Der PDF-Engine-Code kann beim ersten Aufruf geladen werden, aber Ihr Dokument ist nicht Teil dieser Anfrage.

Ist dieses PDF-in-Text-Tool kostenlos?

Ja. Sie können Text extrahieren, bearbeiten, kopieren und herunterladen, ohne Konto, Wasserzeichen oder Zahlung. Die Verarbeitung läuft auf Ihrem Gerät, daher gibt es keine Server-Warteschlange und keine spätere Abholung einer hochgeladenen Datei.

Welche Grenzen gelten bei Dateigröße und Seitenzahl?

Das Tool akzeptiert eine PDF mit bis zu 100 MB und 2.000 Seiten. Verfügbarer Arbeitsspeicher und Gerätespeed können in der Praxis niedriger limitieren, vor allem auf Smartphones. Teilen Sie sehr große Dokumente in kleinere PDFs auf, wenn der Browser nicht fertig wird.

Kann dieses Tool Text aus einer gescannten PDF extrahieren?

Nicht, wenn der Scan nur aus Seitenbildern besteht. Dieser Konverter liest vorhandenen, auswählbaren Text und führt kein OCR aus. Für gescannte PDFs brauchen Sie ein OCR-Tool, das Zeichen aus Pixeln erkennt. Manche gemischten PDFs enthalten auf einzelnen Seiten Text, auf anderen nicht - dafür werden Seiten ohne Text markiert.

Warum ist der extrahierte Text in der falschen Reihenfolge?

PDF-Seiten platzieren Textfragmente an Koordinaten und speichern nicht immer eine klare Absatz- oder Spaltenreihenfolge. PDF.js folgt den Textelementen und Zeilenumbrüchen des Dokuments, was bei mehrspaltigen Layouts, Tabellen, Kopfzeilen oder komplexen Formularen von der sichtbaren Lesereihenfolge abweichen kann.

Bleiben Formatierung und Bilder bei PDF in Text erhalten?

Nein. TXT-Dateien enthalten nur reine Zeichen, daher bleiben Schriftarten, Farben, Bilder, Links, Spalten und Tabellenlinien nicht erhalten. Zeilenumbrüche stammen aus der Textebene der PDF und müssen nach der Extraktion oft noch angepasst werden.

Warum wird meine passwortgeschützte PDF abgelehnt?

Der Browser kann ein verschlüsseltes Dokument ohne Passwort nicht lesen. Öffnen Sie die PDF in einem vertrauenswürdigen Viewer, geben Sie das Passwort ein und speichern Sie eine entsperrte Kopie, wenn Sie dazu berechtigt sind. Fügen Sie dann diese Kopie dem Konverter hinzu.

Welche Sprachen können aus einer PDF extrahiert werden?

Der Parser ist nicht auf eine Sprache festgelegt. Er kann Unicode-Text in jeder Schrift zurückgeben, wenn die PDF eine passende Zeichenzuordnung und auswählbaren Text enthält. Wenn ein Dokument fehlende oder eigene Font-Zuordnungen verwendet, können kopierte Zeichen trotzdem unvollständig oder falsch sein.