Text aus Bild erkennen

Foto, Scan oder Screenshot hineinziehen, Sprache wählen, „Text erkennen“ klicken – und den Text kopieren oder als .txt speichern. Die Erkennung läuft komplett in Ihrem Browser, das Bild wird nicht hochgeladen.

Dateien hierher ziehen oder

JPG, PNG, WebP, HEIC, GIF, BMP oder TIFF – ein Bild, bis 50 MB

Tipp: Bilder lassen sich auch mit Strg + V einfügen.

Ihre Dateien werden nur in Ihrem Browser verarbeitet und nicht hochgeladen – sie verlassen Ihr Gerät nicht.

Beste Ergebnisse: gedruckter Text, gerade fotografiert, scharf, dunkle Schrift auf hellem Grund, Auflösung um 300 dpi. Handschrift wird kaum erkannt.

Erkannter Text

Wählen Sie ein Bild, prüfen Sie die Sprache und klicken Sie auf „Text erkennen“.

Ergebnis

So wird gerechnet

Texterkennung (OCR, Optical Character Recognition) macht aus den Pixeln eines Bildes wieder Buchstaben: Aus dem Foto eines Briefs, dem Scan einer Rechnung oder dem Screenshot eines Dokuments wird Text, den Sie kopieren, durchsuchen und bearbeiten können. Dieses Werkzeug nutzt dafür Tesseract, die bekannteste freie OCR-Engine, als WebAssembly-Version direkt in Ihrem Browser.

So funktioniert's

  1. Bild hineinziehen, auswählen oder mit Strg + V einfügen (etwa einen Screenshot aus der Zwischenablage).
  2. Die Sprache im Bild prüfen. Voreingestellt ist Deutsch; zur Wahl stehen Deutsch, Englisch, Französisch, Spanisch und Portugiesisch.
  3. „Text erkennen“ klicken. Der Balken zeigt, ob gerade Daten geladen oder schon Text erkannt wird.
  4. Den Text im Feld bei Bedarf korrigieren, dann kopieren oder als .txt-Datei speichern.

Tipps für eine gute Erkennung

Grenzen

Tesseract ist für gedruckten Text gebaut. Handschrift wird kaum erkannt, ebenso stark verzierte Schriften, Text in Fotos von Schildern mit Perspektive oder Text auf unruhigem Hintergrund. Tabellen und mehrspaltige Layouts kommen als Fließtext heraus – die Reihenfolge der Spalten kann sich dabei verschieben. Die angezeigte Erkennungssicherheit ist der Mittelwert, den Tesseract für alle Wörter meldet; liegt sie unter etwa 70 %, lohnt ein besseres Bild. Prüfen Sie wichtige Zahlen (Beträge, IBAN, Rechnungsnummern) immer von Hand: Verwechslungen wie 0/O, 1/l oder 5/S kommen auch bei guten Vorlagen vor.

Beim ersten Mal werden Daten geladen

Damit die Erkennung ohne Server funktioniert, lädt Ihr Browser beim ersten Klick auf „Text erkennen“ das Erkennungsprogramm (rund 3,7 MB, komprimiert übertragen etwa 1,5 MB) und die Sprachdaten der gewählten Sprache: Deutsch 1,3 MB, Englisch 2,8 MB, Französisch 0,7 MB, Spanisch 2,0 MB, Portugiesisch 1,3 MB. Alle Dateien liegen auf diesem Server, es wird kein fremdes Content-Delivery-Netzwerk angefragt. Die Sprachdaten speichert der Browser lokal (IndexedDB), beim nächsten Mal geht es deshalb deutlich schneller. Die Erkennung einer Seite dauert je nach Gerät und Bildgröße einige Sekunden.

Datenschutz

Ihr Bild verlässt Ihr Gerät nicht. Die Texterkennung rechnet vollständig in Ihrem Browser (in einem Web Worker), und auch der erkannte Text wird nirgendwohin gesendet. Nach dem Schließen des Tabs ist nichts mehr davon gespeichert – nur die heruntergeladenen Sprachdaten bleiben im Browser-Speicher, bis Sie ihn leeren.

Häufige Fragen

Wird mein Bild hochgeladen?

Nein. Die Texterkennung läuft komplett in Ihrem Browser. Geladen werden nur das Erkennungsprogramm und die Sprachdaten – von diesem Server, nicht von einem fremden Anbieter. Bild und Text bleiben auf Ihrem Gerät.

Welche Sprachen werden erkannt?

Deutsch, Englisch, Französisch, Spanisch und Portugiesisch. Voreingestellt ist die Sprache dieser Seite. Die Sprache sollte zum Text im Bild passen, sonst fehlen Sonderzeichen wie ä, ö, ü, ß oder é, und die Worterkennung wird ungenauer.

Kann das Werkzeug Handschrift lesen?

Kaum. Tesseract ist für gedruckten Text trainiert. Sehr ordentliche Druckbuchstaben klappen manchmal, normale Schreibschrift praktisch nie.

Warum ist der erkannte Text fehlerhaft?

Meist liegt es am Bild: zu klein, unscharf, schräg, zu wenig Kontrast oder ein unruhiger Hintergrund. Fotografieren Sie das Blatt gerade von oben bei gutem Licht, schneiden Sie auf den Text zu und prüfen Sie die gewählte Sprache. Als Richtwert gilt eine Auflösung um 300 dpi.

Warum dauert das erste Erkennen länger?

Beim ersten Mal lädt der Browser das Erkennungsprogramm (komprimiert etwa 1,5 MB) und die Sprachdaten (Deutsch 1,3 MB, Englisch 2,8 MB). Die Sprachdaten werden danach im Browser gespeichert, weitere Bilder gehen schneller.

Kann ich Text aus einem Screenshot kopieren?

Ja. Screenshot aufnehmen (Windows: Win + Umschalt + S, Mac: Cmd + Umschalt + 4), hier mit Strg + V einfügen und „Text erkennen“ klicken. Screenshots sind meist ideal: scharf, gerade und kontrastreich.

Funktioniert das auch mit PDF-Dateien?

Nicht direkt – das Werkzeug liest Bilder. Bei einem gescannten PDF machen Sie einen Screenshot der Seite oder exportieren die Seite als Bild und fügen es hier ein. Enthält das PDF bereits Text, können Sie ihn im PDF-Programm einfach markieren und kopieren.

Wie genau ist die Erkennung?

Bei sauberen Scans und Screenshots in gedruckter Schrift sehr hoch, oft fehlerfrei. Die Erkennungssicherheit unter dem Ergebnis hilft bei der Einschätzung: unter etwa 70 % lohnt ein besseres Bild. Zahlen wie Beträge oder IBAN sollten Sie immer gegenlesen.

Quellen und Rechtsgrundlagen

Stand:

Passende Werkzeuge