Estrarre testo da un’immagine

Trascina una foto, una scansione o uno screenshot, scegli la lingua e clicca su “Estrai testo”: poi copia il testo o salvalo come file .txt. Il riconoscimento avviene interamente nel tuo browser, l’immagine non viene mai caricata online.

Trascina qui i tuoi file oppure

JPG, PNG, WebP, HEIC, GIF, BMP o TIFF – un’immagine, fino a 50 MB

Suggerimento: puoi anche incollare le immagini con Ctrl + V.

I tuoi file vengono elaborati solo nel browser e non vengono caricati su alcun server: non lasciano mai il tuo dispositivo.

Risultati migliori: testo stampato, fotografato dritto e a fuoco, scritta scura su sfondo chiaro, circa 300 dpi. La scrittura a mano viene riconosciuta a malapena.

Testo riconosciuto

Scegli un’immagine, controlla la lingua e clicca su “Estrai testo”.

Risultato

Come si calcola

Il riconoscimento ottico dei caratteri (OCR, Optical Character Recognition) trasforma di nuovo i pixel di un’immagine in lettere: la foto di una lettera, la scansione di una fattura o lo screenshot di un documento diventano testo da copiare, cercare e modificare. Per estrarre il testo da un’immagine questo strumento usa Tesseract, il motore OCR open source più diffuso, compilato in WebAssembly e in esecuzione direttamente nel tuo browser.

Come funziona

  1. Trascina l’immagine, selezionala oppure incollala con Ctrl + V (ad esempio uno screenshot dagli appunti).
  2. Controlla la lingua del testo nell’immagine. L’italiano è preimpostato; puoi scegliere anche inglese, tedesco, francese, spagnolo, portoghese e olandese.
  3. Clicca su “Estrai testo”. La barra di avanzamento mostra se i dati si stanno ancora caricando o se il testo è già in fase di riconoscimento.
  4. Se serve, correggi il testo nel riquadro, poi copialo o salvalo come file .txt.

Consigli per un riconoscimento preciso

Limiti

Tesseract è pensato per il testo stampato. La scrittura a mano viene riconosciuta a malapena, così come i caratteri molto decorativi, le insegne fotografate di sbieco o il testo su sfondi confusi. Tabelle e impaginazioni su più colonne diventano testo continuo, e l’ordine delle colonne può cambiare. L’affidabilità mostrata è la media che Tesseract calcola su tutte le parole; sotto il 70 % circa conviene usare un’immagine migliore. Controlla sempre a mano i numeri importanti (importi, IBAN, numeri di fattura): scambi come 0/O, 1/l o 5/S capitano anche con originali buoni.

Al primo utilizzo vengono scaricati dei dati

Per funzionare senza server, al primo clic su “Estrai testo” il browser scarica il motore di riconoscimento (circa 3,7 MB, circa 1,5 MB compressi durante il trasferimento) e i dati della lingua scelta: italiano 1,6 MB, inglese 2,8 MB, tedesco 1,3 MB, francese 0,7 MB, spagnolo 2,0 MB, portoghese 1,3 MB, olandese 2,9 MB. Tutti i file arrivano da questo sito, nessuna rete di distribuzione esterna viene contattata. Il browser conserva i dati linguistici in locale (IndexedDB), quindi la volta successiva si parte molto più in fretta. Il riconoscimento di una pagina richiede pochi secondi, a seconda del dispositivo e della dimensione dell’immagine.

Privacy

L’immagine non lascia mai il tuo dispositivo. Il riconoscimento avviene interamente nel browser (in un web worker) e nemmeno il testo estratto viene inviato da qualche parte. Chiusa la scheda, non resta nulla; solo i dati linguistici scaricati rimangono nella memoria del browser finché non la svuoti.

Consiglio: ritagliare prima i bordi sfocati con ritagliare immagine migliora il riconoscimento.

Domande frequenti

La mia immagine viene caricata online?

No. Il riconoscimento del testo avviene interamente nel browser. Vengono scaricati solo il motore di riconoscimento e i dati linguistici, da questo sito e non da terzi. L’immagine e il testo restano sul tuo dispositivo.

Quali lingue vengono riconosciute?

Italiano, inglese, tedesco, francese, spagnolo, portoghese e olandese. La lingua di questa pagina è preimpostata. Scegli la lingua del testo nell’immagine, altrimenti mancano caratteri come à, è, ò o ä, ß e il riconoscimento delle parole è meno preciso.

Riconosce la scrittura a mano?

Quasi no. Tesseract è addestrato sul testo stampato. Uno stampatello molto ordinato a volte funziona, il corsivo normale praticamente mai.

Perché il testo contiene errori?

Di solito dipende dall’immagine: troppo piccola, sfocata, storta, con poco contrasto o sfondo confuso. Fotografa il foglio dritto dall’alto con buona luce, ritaglia sul testo e controlla la lingua scelta. Circa 300 dpi sono un buon riferimento.

Perché la prima volta è più lento?

La prima volta il browser scarica il motore di riconoscimento (circa 1,5 MB compressi) e i dati della lingua (italiano 1,6 MB). I dati restano poi salvati nel browser, quindi le immagini successive vanno più veloci.

Posso copiare il testo da uno screenshot?

Sì. Fai lo screenshot (Windows: Win + Maiusc + S, Mac: Cmd + Maiusc + 4), incollalo qui con Ctrl + V e clicca su “Estrai testo”. Gli screenshot sono spesso ideali: nitidi, dritti e ben contrastati.

Funziona anche con i PDF?

Non direttamente: lo strumento legge immagini. Per un PDF scansionato fai uno screenshot della pagina o esportala come immagine e incollala qui. Se il PDF contiene già testo, puoi semplicemente selezionarlo e copiarlo nel tuo lettore PDF.

Quanto è preciso il riconoscimento?

Con scansioni pulite e screenshot di testo stampato è molto alto, spesso senza errori. L’affidabilità mostrata sotto il risultato aiuta a valutare: sotto il 70 % circa conviene un’immagine migliore. Rileggi sempre numeri come importi o IBAN.

Fonti e riferimenti normativi

Aggiornato al:

Strumenti correlati