robots.txt prüfen – mit Sitemap-Check
Hier können Sie die robots.txt prüfen: URL einer Seite eingeben, und der Tester zeigt, ob Googlebot, Bingbot und KI-Crawler wie GPTBot oder ClaudeBot sie abrufen dürfen – samt der Regel, die entscheidet. Dazu kommen Syntax-Hinweise und ein Check der Sitemap: Anzahl der URLs, fremde Hosts und lastmod-Format.
Quelle: RFC 9309 – Robots Exclusion Protocol. Stand: .
So wird gerechnet
Wie Crawler die robots.txt lesen
Die robots.txt liegt immer im Hauptverzeichnis einer Domain (https://example.com/robots.txt) und gilt nur für genau diesen Host und dieses Protokoll. Seit 2022 ist das Format als RFC 9309 standardisiert. Die Regeln im Kern:
- Gruppen: Eine oder mehrere
User-agent-Zeilen, darunterAllow- undDisallow-Regeln. Ein Crawler folgt nur der Gruppe mit seinem Namen – gibt es keine, gilt die GruppeUser-agent: *. - Längste Regel gewinnt: Bei
Disallow: /shopundAllow: /shop/angeboteist /shop/angebote/1 erlaubt. Bei gleicher Länge gewinnt Allow. - Platzhalter:
*steht für beliebige Zeichen,$für das Ende der URL:Disallow: /*.pdf$sperrt alle PDF-Dateien. - Fehlt die Datei (404), darf alles gecrawlt werden. Antwortet der Server mit 5xx, pausiert Google das Crawlen.
Google wertet nur user-agent, allow, disallow und sitemap aus und liest höchstens 500 KiB. Crawl-delay und Noindex ignoriert Google – der Prüfer weist darauf hin.
robots.txt sperrt das Crawlen, nicht die Indexierung
Eine gesperrte URL kann trotzdem in den Suchergebnissen auftauchen, wenn andere Seiten auf sie verlinken – nur ohne Beschreibung. Soll eine Seite sicher aus dem Index verschwinden, braucht sie noindex (Meta-Tag oder X-Robots-Tag) und darf dafür gerade nicht per robots.txt gesperrt sein, sonst sieht Google das noindex nie.
KI-Crawler sperren
Viele Websites wollen Suchmaschinen zulassen, KI-Trainings-Crawler aber nicht. Der Prüfer zeigt deshalb auch GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Nutzung für Googles KI-Modelle) und CCBot (Common Crawl). Beispiel:
User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: /
Sitemap-Check
Nennt die robots.txt eine Sitemap, wird die erste geprüft, sonst der Standardort /sitemap.xml. Nach dem Sitemap-Protokoll darf eine Datei höchstens 50.000 URLs und 50 MB enthalten, alle vom selben Host, und lastmod muss im W3C-Format stehen (z. B. 2026-09-30). Eine neue Sitemap erstellt der Sitemap-Generator.
Grenzen
Gzip-gepackte Sitemaps (.xml.gz) werden nicht entpackt, bei Sitemap-Indexen wird nur der Index gezählt. Sehr große Dateien wertet der Prüfer bis 2 MB aus.
Häufige Fragen
Wie kann ich meine robots.txt testen?
Die Adresse einer Seite Ihrer Website eingeben und „robots.txt prüfen“ klicken. Die Tabelle zeigt für Googlebot, Bingbot, KI-Crawler und alle übrigen Crawler, ob genau diese URL erlaubt ist, und nennt die entscheidende Regel. Google selbst zeigt den robots.txt-Bericht in der Search Console.
Was bedeutet „Disallow: /“?
Der Schrägstrich steht für alle Pfade: Die betroffenen Crawler dürfen nichts von der Website abrufen. Unter User-agent: * sperrt die Zeile die ganze Seite für alle – sinnvoll nur bei Test- oder Staging-Umgebungen.
Wo muss die robots.txt liegen?
Im Hauptverzeichnis des Hosts, also unter https://example.com/robots.txt. Für jede Subdomain (z. B. shop.example.com) und für http und https gilt jeweils eine eigene Datei.
Gehört die Sitemap in die robots.txt?
Das ist optional, aber praktisch: Eine Zeile wie Sitemap: https://example.com/sitemap.xml hilft allen Suchmaschinen, die Sitemap zu finden. Die URL muss vollständig sein, mit https:// und Domain.
Warum ist meine Seite trotz robots.txt-Sperre bei Google zu finden?
Die robots.txt verhindert nur das Abrufen. Verlinken andere Seiten auf die URL, kann Google sie trotzdem ohne Beschreibung listen. Zum Entfernen aus dem Index noindex verwenden und das Crawlen dafür erlauben.
Quellen und Rechtsgrundlagen
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Stand:
Passende Werkzeuge
- Sitemap erstellen: sitemap.xml aus Ihrer URL-ListeSitemap erstellen ohne Anmeldung: URLs einfügen, sitemap.xml nach Sitemaps-Protokoll erzeugen, Fehler prüfen, herunterladen. Läuft komplett im Browser.
- SEO-Check: Webseite kostenlos analysierenSEO-Check per URL: Title, Description, H1, Canonical, hreflang, noindex, Open Graph, strukturierte Daten und alt-Texte prüfen – mit Punktzahl und Tipps.
- Redirect Checker: Weiterleitungskette prüfenDer Redirect Checker zeigt jede Weiterleitung einer URL mit Statuscode (301, 302, 307, 308), Ziel und Zeit – und warnt vor Ketten, Schleifen und HTTPS-Fehlern.
- HTTP-Header-Check mit SicherheitsbewertungAlle HTTP-Header einer URL anzeigen und Security-Header bewerten: HSTS, Content-Security-Policy, X-Frame-Options, Referrer-Policy – Note A bis F mit Tipps.
- HTTP StatuscodesHTTP Statuscodes nachschlagen: Bedeutung von 200, 301, 404, 500 und über 40 weiteren Codes erklärt, mit Suche nach Code oder Stichwort und Filter nach Klasse.
- ASCII-Tabelle mit Dezimal, Hex, Oktal, Binär und Unicode-SucheVollständige ASCII-Tabelle (0–127) und Latin-1 (128–255) mit Dezimal, Hex, Oktal, Binär, HTML-Entity und Steuerzeichen. Suche jedes Unicode-Zeichen samt UTF-8.