Convertir une image en texte
Convertissez une image en texte en quelques secondes : glissez une photo, un scan ou une capture d’écran, choisissez la langue, cliquez sur « Reconnaître le texte » – puis copiez le texte ou enregistrez-le en .txt. La reconnaissance tourne entièrement dans votre navigateur, l’image n’est jamais envoyée en ligne.
Comment le calcul est fait
La reconnaissance de texte (OCR, Optical Character Recognition) refait des lettres à partir des pixels d’une image : la photo d’une lettre, le scan d’une facture ou la capture d’écran d’un document redevient un texte que vous pouvez copier, chercher et modifier. Cet outil utilise pour cela Tesseract, le moteur OCR libre le plus connu, dans sa version WebAssembly directement dans votre navigateur.
Mode d’emploi
- Glissez l’image, sélectionnez-la ou collez-la avec Ctrl + V (par exemple une capture d’écran depuis le presse-papiers).
- Vérifiez la langue de l’image. Le français est sélectionné par défaut ; vous pouvez aussi choisir allemand, anglais, espagnol ou portugais.
- Cliquez sur « Reconnaître le texte ». La barre indique si des données sont en cours de chargement ou si le texte est déjà en cours de reconnaissance.
- Corrigez le texte dans le champ si besoin, puis copiez-le ou enregistrez-le en fichier .txt.
Conseils pour une bonne reconnaissance
- Contraste : une écriture foncée sur un fond clair et uniforme fonctionne le mieux. Ombres, dégradés, motifs ou filigranes derrière le texte réduisent la précision.
- Photo bien droite : photographiez la feuille de face, jamais en biais. Des lignes très inclinées ou courbées (pli d’un livre) sont bien moins bien reconnues.
- Résolution : comptez environ 300 dpi pour un scan. Pour une photo, cela veut dire que le texte doit être assez grand dans l’image : des majuscules d’au moins 20 pixels de hauteur environ. L’outil agrandit automatiquement les images très petites (au maximum le double) et réduit les très grandes à 5 000 pixels de côté.
- Cadrage : ne gardez que la zone avec le texte, sans les bords, les mains ni le bord de la table. Pour une capture d’écran, cadrez la fenêtre plutôt que tout l’écran.
- Bonne langue : la langue détermine le dictionnaire et les caractères. Avec « anglais », les accents et cédilles français manquent ; avec « français », l’allemand perd ses ä, ö, ü et ß.
Limites
Tesseract est conçu pour du texte imprimé. L’écriture manuscrite est à peine reconnue, tout comme les polices très ornées, le texte de panneaux photographiés en perspective ou sur un fond chargé. Les tableaux et les mises en page à plusieurs colonnes ressortent en texte continu, l’ordre des colonnes pouvant s’en trouver mélangé. La fiabilité affichée est la moyenne que Tesseract calcule pour tous les mots ; en dessous d’environ 70 %, une meilleure image vaut la peine. Vérifiez toujours à la main les chiffres importants (montants, IBAN, numéros de facture) : des confusions comme 0/O, 1/l ou 5/S arrivent même sur de bonnes images.
Des données sont chargées la première fois
Pour fonctionner sans serveur, votre navigateur charge, au premier clic sur « Reconnaître le texte », le moteur de reconnaissance (environ 3,7 Mo, environ 1,5 Mo une fois compressé) ainsi que les données de la langue choisie : français 0,7 Mo, allemand 1,3 Mo, portugais 1,3 Mo, espagnol 2,0 Mo, anglais 2,8 Mo. Tous les fichiers sont hébergés sur ce serveur, aucun réseau de diffusion de contenu externe n’est sollicité. Le navigateur enregistre les données linguistiques localement (IndexedDB) ; la prochaine fois, tout ira donc nettement plus vite. La reconnaissance d’une page prend quelques secondes selon l’appareil et la taille de l’image.
Confidentialité
Votre image ne quitte jamais votre appareil. La reconnaissance de texte s’exécute entièrement dans votre navigateur (dans un web worker), et le texte reconnu n’est envoyé nulle part non plus. Une fois l’onglet fermé, plus rien n’en subsiste – seules les données linguistiques téléchargées restent dans le stockage du navigateur, jusqu’à ce que vous le videz.
Questions fréquentes
Mon image est-elle envoyée en ligne ?
Non. La reconnaissance de texte tourne entièrement dans votre navigateur. Seuls le moteur de reconnaissance et les données linguistiques sont chargés – depuis ce serveur, pas depuis un fournisseur externe. L’image et le texte restent sur votre appareil.
Quelles langues sont reconnues ?
Allemand, anglais, français, espagnol et portugais. La langue de cette page est sélectionnée par défaut. Elle doit correspondre au texte de l’image, sinon des caractères spéciaux comme é, à, ç ou ä, ö, ü, ß manquent et la reconnaissance des mots devient moins précise.
L’outil peut-il lire l’écriture manuscrite ?
À peine. Tesseract est entraîné pour du texte imprimé. Une écriture en lettres bâton très soignée passe parfois, une écriture cursive normale presque jamais.
Pourquoi le texte reconnu contient-il des erreurs ?
C’est presque toujours l’image en cause : trop petite, floue, de travers, pas assez de contraste ou fond trop chargé. Photographiez la feuille bien droite, de face, avec une bonne lumière, cadrez sur le texte et vérifiez la langue choisie. Comptez environ 300 dpi de résolution.
Pourquoi la première reconnaissance est-elle plus longue ?
La première fois, le navigateur charge le moteur de reconnaissance (environ 1,5 Mo compressé) et les données linguistiques (français 0,7 Mo, allemand 1,3 Mo). Ces données restent ensuite enregistrées dans le navigateur, les images suivantes vont plus vite.
Puis-je copier le texte d’une capture d’écran ?
Oui. Faites la capture (Windows : Win + Maj + S, Mac : Cmd + Maj + 4), collez-la ici avec Ctrl + V et cliquez sur « Reconnaître le texte ». Les captures d’écran sont souvent idéales : nettes, droites et bien contrastées.
Est-ce que cela fonctionne aussi avec des fichiers PDF ?
Pas directement – l’outil lit des images. Pour un PDF scanné, faites une capture d’écran de la page ou exportez-la en image, puis déposez-la ici. Si le PDF contient déjà du texte, vous pouvez le sélectionner et le copier directement dans votre lecteur PDF.
Quelle est la fiabilité de la reconnaissance ?
Très élevée, souvent sans erreur, sur des scans et captures d’écran propres en texte imprimé. La fiabilité indiquée sous le résultat aide à juger : en dessous d’environ 70 %, une meilleure image vaut la peine. Relisez toujours les chiffres comme les montants ou l’IBAN.
Sources et références juridiques
- Tesseract.js – bibliothèque OCR pour le navigateur (GitHub, Apache-2.0)
- Documentation Tesseract OCR – améliorer la qualité de la reconnaissance (en anglais)
- Licences : Tesseract.js, moteur Tesseract et données linguistiques (Apache-2.0)
Dernière mise à jour :
Outils similaires
- Nettoyer un texte en ligneSupprimer les sauts de ligne, espaces en trop, lignes vides et caractères invisibles, retirer les doublons et trier les lignes : gratuit, dans le navigateur.
- Compteur de mots et de caractèresComptez les caractères avec et sans espaces, les mots, les phrases et le temps de lecture – en direct, avec les limites de X, Instagram, TikTok, LinkedIn, SMS.
- Convertir majuscule en minuscule et inversementMettre un texte en majuscules ou en minuscules, majuscule en début de phrase ou à chaque mot, camelCase, snake_case : conversion gratuite, accents compris.
- Compresser une image : réduire la taille du fichierCompresser une image sans l’envoyer en ligne : réduisez JPG, PNG, WebP et HEIC, 20 images à la fois, avec taille cible en Ko et téléchargement ZIP. Gratuit.
- Comparer deux textes : trouver les différencesComparez deux textes en ligne : différences surlignées par ligne, mot ou caractère, avec un taux de similarité. Gratuit, sans envoi, dans le navigateur.
- Compteur de hashtags et mise en forme de légende InstagramComptez les hashtags et mentions @, repérez les doublons et mettez en forme votre légende Instagram : hashtags à la fin, paragraphes conservés.