Tester robots.txt et le sitemap d’un site
Pour tester robots.txt, saisissez l’URL d’une page : l’outil indique si Googlebot, Bingbot et les robots d’IA comme GPTBot ou ClaudeBot peuvent l’explorer, avec la règle qui décide. Il signale aussi les erreurs de syntaxe et contrôle le sitemap : nombre d’URL, hôtes étrangers et format lastmod.
Source : RFC 9309 – Robots Exclusion Protocol. Mise à jour : .
Comment le calcul est fait
Comment les robots lisent le robots.txt
Le fichier se trouve toujours à la racine d’un hôte (https://example.com/robots.txt) et ne vaut que pour cet hôte et ce protocole. Son format est normalisé depuis 2022 par la RFC 9309 :
- Groupes : une ou plusieurs lignes
User-agent, suivies de règlesAllowetDisallow. Un robot suit uniquement le groupe à son nom, sinon le groupeUser-agent: *. - La règle la plus longue gagne : avec
Disallow: /boutiqueetAllow: /boutique/promos, /boutique/promos/1 est autorisé. À égalité, Allow l’emporte. - Jokers :
*remplace n’importe quels caractères,$marque la fin de l’URL :Disallow: /*.pdf$bloque tous les PDF. - Fichier absent (404) : tout peut être exploré. En cas de 5xx, Google suspend l’exploration.
Google ne lit que user-agent, allow, disallow et sitemap, et au plus 500 Kio. Crawl-delay et Noindex sont ignorés par Google – l’outil le signale.
Bloquer l’exploration n’empêche pas l’indexation
Une URL bloquée peut apparaître dans les résultats si d’autres pages y renvoient, simplement sans description. Pour retirer une page de l’index, utilisez noindex (balise meta ou X-Robots-Tag) et laissez-la explorable, sinon Google ne voit jamais ce noindex.
Robots d’IA et sitemap
L’outil teste aussi GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (utilisation pour les modèles d’IA de Google) et CCBot (Common Crawl) : un groupe User-agent: GPTBot avec Disallow: / suffit à exclure l’un d’eux. Le premier sitemap cité dans le robots.txt est ensuite contrôlé, à défaut /sitemap.xml : 50 000 URL et 50 Mo au maximum, un seul hôte, lastmod au format W3C. Pour en créer un, utilisez le générateur de sitemap XML. Les sitemaps compressés (.xml.gz) ne sont pas décompressés et les fichiers volumineux sont lus jusqu’à 2 Mo.
Questions fréquentes
Comment tester mon fichier robots.txt ?
Saisissez l’adresse d’une page de votre site et cliquez sur « Tester robots.txt ». Le tableau indique pour Googlebot, Bingbot, les robots d’IA et tous les autres si cette URL précise est autorisée, et quelle règle décide. Google propose aussi un rapport robots.txt dans la Search Console.
Que signifie « Disallow: / » ?
La barre oblique désigne tous les chemins : les robots concernés ne peuvent rien explorer. Sous User-agent: *, le site entier est bloqué pour tous – à réserver aux environnements de test ou de préproduction.
Robots.txt, c’est quoi exactement ?
Un simple fichier texte à la racine du site qui indique aux robots d’exploration quelles zones ils peuvent parcourir. Il ne protège rien : les robots malveillants l’ignorent, et il ne remplace pas un mot de passe.
Faut-il indiquer le sitemap dans le robots.txt ?
C’est facultatif mais pratique : une ligne Sitemap: https://example.com/sitemap.xml aide tous les moteurs à le trouver. L’URL doit être complète, avec https:// et le domaine.
Pourquoi ma page bloquée apparaît-elle quand même sur Google ?
Le robots.txt empêche seulement la récupération. Si d’autres pages font un lien vers l’URL, Google peut l’afficher sans description. Pour la retirer, utilisez noindex et autorisez l’exploration.
Sources et références juridiques
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Dernière mise à jour :
Outils similaires
- Générateur sitemap XML : créez votre sitemap.xml à partir d’URLGénérateur sitemap XML sans inscription : collez vos URL, obtenez un sitemap.xml valide selon le protocole Sitemaps, vérifiez les erreurs. Dans le navigateur.
- Analyse SEO gratuite d’une page webAnalyse SEO en ligne d’une URL : title, meta description, H1, canonical, hreflang, noindex, Open Graph, données structurées et alt – avec score et conseils.
- Vérifier une redirection et toute sa chaîneVérifier une redirection en ligne : chaque étape d’une URL avec son code (301, 302, 307, 308), sa cible et sa durée – boucles et erreurs HTTPS signalées.
- Vérifier les en-têtes HTTP d’un siteAffichez les en-têtes HTTP d’une URL et notez ses headers de sécurité : HSTS, Content-Security-Policy, X-Frame-Options, Referrer-Policy – note de A à F.
- Codes HTTPCodes HTTP expliqués : signification de 200, 301, 404, 500 et de plus de 40 autres codes, avec recherche par code ou mot-clé et filtre par classe.
- Algorithme de Luhn : vérifier et calculer une cléVérifiez un numéro avec l’algorithme de Luhn (modulo 10, ISO/IEC 7812-1) ou calculez sa clé – simple contrôle de format, en local dans le navigateur.