Convertir un PDF en texte
Convertir un PDF en texte en un clic : déposez le PDF, cliquez sur « Extraire le texte », c’est fait. Les lignes coupées redeviennent des paragraphes propres, et la reconnaissance de texte (OCR) lit les pages scannées. Tout se passe dans votre navigateur, rien n’est envoyé.
Source : Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7). Mise à jour : .
Comment le calcul est fait
Copier le texte d’un PDF donne souvent un résultat désordonné : retours à la ligne au milieu des phrases, mots coupés (« docu-ment »), colonnes mélangées. Cet outil lit la couche texte du PDF avec pdf.js, regroupe les fragments en lignes selon leur position sur la page, puis en paragraphes. Vous pouvez modifier le résultat, le copier ou l’enregistrer en fichier TXT (UTF-8).
Mode d’emploi
- Déposez ou choisissez un PDF.
- Choisissez la mise en forme : « Paragraphes » donne un texte continu à retravailler, « Lignes comme dans le PDF » garde chaque retour à la ligne (adresses, poèmes, listes).
- Cochez si besoin « Marquer les changements de page » pour ajouter « --- Page 3 --- ».
- Cliquez sur « Extraire le texte », vérifiez, copiez ou enregistrez. Les options se changent ensuite sans relire le PDF.
PDF scannés : reconnaissance de texte (OCR)
Un scan est une image sans couche texte. Si une page compte moins de 20 caractères, l’outil la dessine à environ 300 dpi et la fait lire par Tesseract, le moteur OCR libre qu’utilise aussi Image en texte. Choisissez la langue du document. Comptez quelques secondes par page ; le résultat est très fiable sur un scan net, beaucoup moins sur de l’écriture manuscrite ou une mauvaise copie.
Limites
- Tableaux et mises en page en colonnes sont lus ligne par ligne ; les colonnes peuvent se mélanger. Pour un document modifiable avec titres, utilisez PDF en DOCX.
- Certains PDF utilisent des polices sans table de caractères : on obtient des carrés ou du charabia. Cochez alors « Lire toutes les pages par OCR ».
- Un PDF protégé s’ouvre avec son mot de passe ; l’outil ne contourne pas une protection contre la copie.
Confidentialité
Le PDF reste sur votre appareil. Seuls le moteur PDF et, si besoin, l’OCR sont chargés depuis ce site : aucun service tiers ne voit votre document. Pour un texte structuré (notes, IA), voyez PDF en Markdown.
Questions fréquentes
Comment convertir un PDF en texte gratuitement ?
Déposez le PDF ici et cliquez sur « Extraire le texte ». Copiez-le d’un clic ou enregistrez-le en TXT. Sans inscription ni envoi.
Comment extraire le texte d’un PDF scanné ?
Laissez « Lire les pages scannées par OCR » coché et choisissez la langue du document. Les pages sans couche texte sont alors lues automatiquement.
Pourquoi le texte copié d’un PDF a-t-il tant de retours à la ligne ?
Le PDF stocke le texte ligne par ligne. Avec « Paragraphes », l’outil réunit les lignes qui vont ensemble et supprime les coupures de mots en fin de ligne.
Puis-je coller le texte dans Word ?
Oui : cliquez sur « Copier » puis collez. Pour garder titres et paragraphes dans un fichier Word, utilisez « PDF en DOCX ».
Mon PDF est-il envoyé en ligne ?
Non. La lecture et l’OCR se font entièrement dans votre navigateur.
Pourquoi je ne vois que des carrés ou des caractères bizarres ?
Le PDF utilise des polices non reliées à de vraies lettres. Cochez « Lire toutes les pages par OCR » et relancez : l’OCR lit alors ce qui est imprimé.
Sources et références juridiques
- Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7)
- pdf.js – getTextContent / getAnnotations (Mozilla, Apache-2.0)
- pdf.js 6.3.289 licence (Apache-2.0)
- Tesseract.js – OCR library for the browser (GitHub, Apache-2.0)
- Tesseract OCR documentation – Improving the quality of the output
- Unicode Standard – UTF-8 encoding form (TXT export)
- Open-source licenses of the libraries used (MIT, LGPL-3.0)
Dernière mise à jour :
Outils similaires
- Convertir un PDF en MarkdownPDF en Markdown : titres, paragraphes, listes et liens en .md, pour Obsidian, GitHub, vos notes ou une IA. OCR pour les scans, gratuit, sans envoi de fichier.
- Convertir un PDF en DOCXTransformer un PDF en fichier DOCX modifiable pour Word ou LibreOffice, directement dans le navigateur, pages scannées par OCR. Sans envoi ni inscription.
- Convertir une image en texteImage en texte : copiez le texte d’une photo, d’un scan ou d’une capture d’écran. OCR en français, allemand, anglais, espagnol et portugais, dans le navigateur.
- Convertir un PDF en JPGConvertissez un PDF en JPG ou PNG : chaque page en image, 72 à 300 dpi, une par une ou en ZIP. Gratuit, directement dans le navigateur – rien n’est envoyé.
- Nettoyer un texte en ligneSupprimer les sauts de ligne, espaces en trop, lignes vides et caractères invisibles, retirer les doublons et trier les lignes : gratuit, dans le navigateur.
- Ajouter un cadre à une photoAjouter un cadre à une photo en ligne : bord blanc ou coloré, style photo instantanée, coins arrondis et cadre transparent, avec aperçu. Gratuit, sans envoi.