PDF in Text umwandeln
PDF in Text umwandeln mit einem Klick: PDF hineinziehen, „Text extrahieren“ klicken, fertig. Umbrochene Zeilen werden zu sauberen Absätzen, eingescannte Seiten liest die Texterkennung (OCR). Alles läuft in Ihrem Browser – die Datei wird nicht hochgeladen.
Quelle: Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7). Stand: .
So wird gerechnet
Aus einer PDF Text herauszukopieren, endet oft im Chaos: harte Zeilenumbrüche mitten im Satz, getrennte Wörter („Zei-len“), vertauschte Spalten. Dieses Werkzeug liest die Textebene der PDF mit pdf.js, ordnet die Textstücke nach ihrer Lage auf der Seite zu Zeilen und fügt sie zu Absätzen zusammen. Das Ergebnis können Sie direkt bearbeiten, kopieren oder als TXT-Datei (UTF-8) speichern.
So funktioniert's
- PDF hineinziehen oder auswählen.
- Textform wählen: „Absätze“ ergibt Fließtext zum Weiterschreiben, „Zeilen wie im PDF“ behält jeden Umbruch – gut für Adressen, Gedichte oder Listen.
- Optional „Seitenwechsel markieren“: Dann steht vor jeder Seite „--- Seite 3 ---“.
- „Text extrahieren“ klicken, Ergebnis prüfen, kopieren oder speichern. Die Optionen lassen sich danach umstellen, ohne die PDF neu zu lesen.
Eingescannte PDFs: Texterkennung (OCR)
Ein Scan ist ein Bild ohne Textebene. Findet das Werkzeug auf einer Seite weniger als 20 Zeichen, zeichnet es die Seite mit etwa 300 dpi und lässt sie von Tesseract lesen – derselben freien OCR-Engine, die auch Text aus Bild erkennen nutzt. Wählen Sie dafür die Sprache des Dokuments. Die Erkennung braucht je Seite einige Sekunden; bei sauberen Scans ist sie sehr genau, bei Handschrift oder schlechten Kopien nicht.
Ehrliche Grenzen
- Tabellen und mehrspaltige Layouts werden zeilenweise gelesen; Spalten können ineinanderlaufen. Für bearbeitbare Dokumente mit Überschriften eignet sich PDF in DOCX.
- Manche PDFs haben Schriften ohne Zeichentabelle: Dann erscheinen Kästchen oder Zeichensalat. Hier hilft „Alle Seiten per OCR lesen“.
- Passwortgeschützte PDFs öffnen Sie mit dem Passwort; einen Kopierschutz umgeht das Werkzeug nicht.
Datenschutz
Die PDF bleibt auf Ihrem Gerät. Geladen werden nur die PDF-Engine und bei Bedarf die Texterkennung von diesem Server – kein Dienst eines Dritten sieht Ihr Dokument. Strukturierten Text für Notizen oder KI-Chats liefert PDF in Markdown.
Häufige Fragen
Wie kann ich eine PDF kostenlos in Text umwandeln?
PDF hier hineinziehen und „Text extrahieren“ klicken. Den Text kopieren Sie mit einem Klick oder speichern ihn als TXT-Datei. Ohne Anmeldung und ohne Upload.
Wie wandle ich eine eingescannte PDF in Text um?
Lassen Sie „Gescannte Seiten per Texterkennung (OCR) lesen“ eingeschaltet und wählen Sie die Sprache des Dokuments. Seiten ohne Textebene werden dann automatisch per OCR gelesen.
Warum hat der kopierte PDF-Text so viele Zeilenumbrüche?
PDFs speichern Text zeilenweise, nicht als Absatz. Mit der Textform „Absätze“ fügt das Werkzeug zusammengehörige Zeilen wieder zusammen und löst Silbentrennungen am Zeilenende auf.
Kann ich den PDF-Text in Word einfügen?
Ja: „Kopieren“ klicken und in Word einfügen. Sollen Überschriften und Absätze als Word-Datei erhalten bleiben, nehmen Sie „PDF in DOCX“.
Wird meine PDF hochgeladen?
Nein. Lesen und Texterkennung laufen vollständig in Ihrem Browser.
Warum erscheinen nur Kästchen oder seltsame Zeichen?
Die PDF nutzt Schriften ohne Zuordnung zu echten Buchstaben. Haken Sie „Alle Seiten per OCR lesen“ an und extrahieren Sie erneut – die Texterkennung liest dann das Schriftbild statt der kaputten Textebene.
Quellen und Rechtsgrundlagen
- Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7)
- pdf.js – getTextContent / getAnnotations (Mozilla, Apache-2.0)
- pdf.js 6.3.289 licence (Apache-2.0)
- Tesseract.js – OCR library for the browser (GitHub, Apache-2.0)
- Tesseract OCR documentation – Improving the quality of the output
- Unicode Standard – UTF-8 encoding form (TXT export)
- Open-source licenses of the libraries used (MIT, LGPL-3.0)
Stand:
Passende Werkzeuge
- PDF in Markdown umwandelnPDF in Markdown umwandeln: Überschriften, Absätze, Listen und Links als .md – für Obsidian, GitHub, Notizen oder KI-Chats. Mit OCR für Scans, ohne Upload.
- PDF in DOCX umwandelnPDF in eine bearbeitbare DOCX-Datei umwandeln, z. B. für Word oder LibreOffice – direkt im Browser, gescannte Seiten per OCR. Ohne Upload und ohne Anmeldung.
- Text aus Bild erkennenText aus Bild, Foto oder Screenshot kopieren: OCR für Deutsch, Englisch, Französisch, Spanisch und Portugiesisch. Direkt im Browser, ohne Upload.
- PDF in JPG umwandelnPDF in JPG oder PNG umwandeln: jede Seite als eigenes Bild, 72 bis 300 dpi, einzeln oder als ZIP. Kostenlos, direkt im Browser – ohne Upload.
- Text bereinigenDoppelte Leerzeichen, leere Zeilen, Zeilenumbrüche und unsichtbare Zeichen entfernen, doppelte Zeilen löschen und sortieren – kostenlos, direkt im Browser.
- Audio konvertieren: MP3, WAV, M4A oder OGGAudio konvertieren im Browser: MP3, WAV, M4A, OGG, FLAC oder den Ton eines Videos in MP3, WAV, M4A oder OGG umwandeln. Ohne Upload, mit Bitrate, kostenlos.