robots.txt prüfen – mit Sitemap-Check

Hier können Sie die robots.txt prüfen: URL einer Seite eingeben, und der Tester zeigt, ob Googlebot, Bingbot und KI-Crawler wie GPTBot oder ClaudeBot sie abrufen dürfen – samt der Regel, die entscheidet. Dazu kommen Syntax-Hinweise und ein Check der Sitemap: Anzahl der URLs, fremde Hosts und lastmod-Format.

Quelle: RFC 9309 – Robots Exclusion Protocol. Stand: .

Meine Toolbox

Beim Klick sendet Ihr Browser die eingegebene URL an unseren Server (Cloudflare Worker). Er ruft die Seite als „ToolboxDayBot“ ab, beachtet ihre robots.txt und schickt nur die Auswertung zurück. URL und IP-Adresse werden nicht gespeichert; für das Limit von 30 Abrufen pro Stunde zählt der Server einen nicht umkehrbaren Hash Ihrer IP höchstens eine Stunde lang im Arbeitsspeicher.

Ergebnis

Ergebnis
–
Darf gecrawlt werden?
Prüfpunkte
Tipps
Regeln der robots.txt
Sitemap-Auszug

So wird gerechnet

Wie Crawler die robots.txt lesen

Die robots.txt liegt immer im Hauptverzeichnis einer Domain (https://example.com/robots.txt) und gilt nur für genau diesen Host und dieses Protokoll. Seit 2022 ist das Format als RFC 9309 standardisiert. Die Regeln im Kern:

Google wertet nur user-agent, allow, disallow und sitemap aus und liest höchstens 500 KiB. Crawl-delay und Noindex ignoriert Google – der Prüfer weist darauf hin.

robots.txt sperrt das Crawlen, nicht die Indexierung

Eine gesperrte URL kann trotzdem in den Suchergebnissen auftauchen, wenn andere Seiten auf sie verlinken – nur ohne Beschreibung. Soll eine Seite sicher aus dem Index verschwinden, braucht sie noindex (Meta-Tag oder X-Robots-Tag) und darf dafür gerade nicht per robots.txt gesperrt sein, sonst sieht Google das noindex nie.

KI-Crawler sperren

Viele Websites wollen Suchmaschinen zulassen, KI-Trainings-Crawler aber nicht. Der Prüfer zeigt deshalb auch GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Nutzung für Googles KI-Modelle) und CCBot (Common Crawl). Beispiel:

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Sitemap-Check

Nennt die robots.txt eine Sitemap, wird die erste geprüft, sonst der Standardort /sitemap.xml. Nach dem Sitemap-Protokoll darf eine Datei höchstens 50.000 URLs und 50 MB enthalten, alle vom selben Host, und lastmod muss im W3C-Format stehen (z. B. 2026-09-30). Eine neue Sitemap erstellt der Sitemap-Generator.

Grenzen

Gzip-gepackte Sitemaps (.xml.gz) werden nicht entpackt, bei Sitemap-Indexen wird nur der Index gezählt. Sehr große Dateien wertet der Prüfer bis 2 MB aus.

Häufige Fragen

Wie kann ich meine robots.txt testen?

Die Adresse einer Seite Ihrer Website eingeben und „robots.txt prüfen“ klicken. Die Tabelle zeigt für Googlebot, Bingbot, KI-Crawler und alle übrigen Crawler, ob genau diese URL erlaubt ist, und nennt die entscheidende Regel. Google selbst zeigt den robots.txt-Bericht in der Search Console.

Was bedeutet „Disallow: /“?

Der Schrägstrich steht für alle Pfade: Die betroffenen Crawler dürfen nichts von der Website abrufen. Unter User-agent: * sperrt die Zeile die ganze Seite für alle – sinnvoll nur bei Test- oder Staging-Umgebungen.

Wo muss die robots.txt liegen?

Im Hauptverzeichnis des Hosts, also unter https://example.com/robots.txt. Für jede Subdomain (z. B. shop.example.com) und für http und https gilt jeweils eine eigene Datei.

Gehört die Sitemap in die robots.txt?

Das ist optional, aber praktisch: Eine Zeile wie Sitemap: https://example.com/sitemap.xml hilft allen Suchmaschinen, die Sitemap zu finden. Die URL muss vollständig sein, mit https:// und Domain.

Warum ist meine Seite trotz robots.txt-Sperre bei Google zu finden?

Die robots.txt verhindert nur das Abrufen. Verlinken andere Seiten auf die URL, kann Google sie trotzdem ohne Beschreibung listen. Zum Entfernen aus dem Index noindex verwenden und das Crawlen dafür erlauben.

Quellen und Rechtsgrundlagen

Stand:

Passende Werkzeuge