Tester robots.txt et le sitemap d’un site

Pour tester robots.txt, saisissez l’URL d’une page : l’outil indique si Googlebot, Bingbot et les robots d’IA comme GPTBot ou ClaudeBot peuvent l’explorer, avec la règle qui décide. Il signale aussi les erreurs de syntaxe et contrôle le sitemap : nombre d’URL, hôtes étrangers et format lastmod.

Source : RFC 9309 – Robots Exclusion Protocol. Mise à jour : .

Au clic, votre navigateur envoie l’URL saisie à notre serveur (Cloudflare Worker). Celui-ci récupère la page en tant que « ToolboxDayBot », respecte son robots.txt et ne renvoie que l’analyse. Ni l’URL ni l’adresse IP ne sont enregistrées ; pour la limite de 30 vérifications par heure, le serveur conserve en mémoire vive, une heure au plus, une empreinte irréversible (hash) de votre IP.

Résultat

Résultat
–
Exploration autorisée ?
Points contrôlés
Conseils
Règles du robots.txt
Extrait du sitemap

Comment le calcul est fait

Comment les robots lisent le robots.txt

Le fichier se trouve toujours à la racine d’un hôte (https://example.com/robots.txt) et ne vaut que pour cet hôte et ce protocole. Son format est normalisé depuis 2022 par la RFC 9309 :

Google ne lit que user-agent, allow, disallow et sitemap, et au plus 500 Kio. Crawl-delay et Noindex sont ignorés par Google – l’outil le signale.

Bloquer l’exploration n’empêche pas l’indexation

Une URL bloquée peut apparaître dans les résultats si d’autres pages y renvoient, simplement sans description. Pour retirer une page de l’index, utilisez noindex (balise meta ou X-Robots-Tag) et laissez-la explorable, sinon Google ne voit jamais ce noindex.

Robots d’IA et sitemap

L’outil teste aussi GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (utilisation pour les modèles d’IA de Google) et CCBot (Common Crawl) : un groupe User-agent: GPTBot avec Disallow: / suffit à exclure l’un d’eux. Le premier sitemap cité dans le robots.txt est ensuite contrôlé, à défaut /sitemap.xml : 50 000 URL et 50 Mo au maximum, un seul hôte, lastmod au format W3C. Pour en créer un, utilisez le générateur de sitemap XML. Les sitemaps compressés (.xml.gz) ne sont pas décompressés et les fichiers volumineux sont lus jusqu’à 2 Mo.

Questions fréquentes

Comment tester mon fichier robots.txt ?

Saisissez l’adresse d’une page de votre site et cliquez sur « Tester robots.txt ». Le tableau indique pour Googlebot, Bingbot, les robots d’IA et tous les autres si cette URL précise est autorisée, et quelle règle décide. Google propose aussi un rapport robots.txt dans la Search Console.

Que signifie « Disallow: / » ?

La barre oblique désigne tous les chemins : les robots concernés ne peuvent rien explorer. Sous User-agent: *, le site entier est bloqué pour tous – à réserver aux environnements de test ou de préproduction.

Robots.txt, c’est quoi exactement ?

Un simple fichier texte à la racine du site qui indique aux robots d’exploration quelles zones ils peuvent parcourir. Il ne protège rien : les robots malveillants l’ignorent, et il ne remplace pas un mot de passe.

Faut-il indiquer le sitemap dans le robots.txt ?

C’est facultatif mais pratique : une ligne Sitemap: https://example.com/sitemap.xml aide tous les moteurs à le trouver. L’URL doit être complète, avec https:// et le domaine.

Pourquoi ma page bloquée apparaît-elle quand même sur Google ?

Le robots.txt empêche seulement la récupération. Si d’autres pages font un lien vers l’URL, Google peut l’afficher sans description. Pour la retirer, utilisez noindex et autorisez l’exploration.

Sources et références juridiques

Dernière mise à jour :

Outils similaires