robots.txt tester ze sprawdzeniem mapy witryny
Ten robots.txt tester pokazuje dla wpisanego adresu, czy Googlebot, Bingbot i roboty AI, takie jak GPTBot czy ClaudeBot, mogą go pobrać – i która reguła o tym decyduje. Wskazuje też błędy składni i sprawdza mapę witryny: liczbę adresów, obce hosty i format lastmod.
Źródło: RFC 9309 – Robots Exclusion Protocol. Stan na: .
Jak to obliczamy
Jak roboty czytają robots.txt
Plik leży zawsze w katalogu głównym hosta (https://example.com/robots.txt) i dotyczy tylko tego hosta i protokołu. Od 2022 roku jego format opisuje standard RFC 9309:
- Grupy: jeden lub kilka wierszy
User-agent, a pod nimi regułyAllowiDisallow. Robot stosuje tylko grupę ze swoją nazwą, a gdy jej nie ma – grupęUser-agent: *. - Wygrywa najdłuższa reguła: przy
Disallow: /sklepiAllow: /sklep/promocjeadres /sklep/promocje/1 jest dozwolony. Przy remisie wygrywa Allow. - Symbole wieloznaczne:
*oznacza dowolne znaki,$koniec adresu:Disallow: /*.pdf$blokuje wszystkie pliki PDF. - Brak pliku (404) oznacza, że wszystko wolno skanować. Przy błędzie 5xx Google wstrzymuje skanowanie.
Google czyta tylko user-agent, allow, disallow i sitemap, najwyżej 500 KiB. Crawl-delay i Noindex Google ignoruje – tester o tym informuje.
Blokada skanowania to nie blokada indeksowania
Zablokowany adres może pojawić się w wynikach, jeśli linkują do niego inne strony – tylko bez opisu. Aby usunąć stronę z indeksu, użyj noindex (meta tag lub X-Robots-Tag) i pozwól ją skanować, inaczej Google nigdy nie zobaczy noindex.
Roboty AI i mapa witryny
Tester sprawdza też GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (wykorzystanie w modelach AI Google) i CCBot (Common Crawl): grupa User-agent: GPTBot z Disallow: / wystarczy, by zablokować jednego z nich. Następnie sprawdza pierwszą mapę witryny z robots.txt, a gdy jej brak – /sitemap.xml: maksymalnie 50 000 adresów i 50 MB, jeden host i lastmod w formacie W3C. Nową mapę utworzysz w generatorze sitemap XML. Mapy spakowane (.xml.gz) nie są rozpakowywane, a duże pliki czytamy do 2 MB.
Najczęściej zadawane pytania
Jak przetestować plik robots.txt?
Wpisz adres strony ze swojej witryny i kliknij „Sprawdź robots.txt”. Tabela pokaże dla Googlebota, Bingbota, robotów AI i pozostałych, czy ten konkretny adres jest dozwolony i która reguła decyduje. Google udostępnia też raport robots.txt w Search Console.
Robots.txt – co to jest?
To plik tekstowy w katalogu głównym witryny, który mówi robotom wyszukiwarek, które obszary mogą przeglądać. Niczego nie zabezpiecza: złośliwe boty go ignorują i nie zastępuje hasła.
Co oznacza „Disallow: /”?
Ukośnik oznacza wszystkie ścieżki: roboty z tej grupy nie mogą niczego pobrać. Pod User-agent: * blokuje całą witrynę dla wszystkich – sensowne tylko w środowiskach testowych.
Czy mapę witryny trzeba wpisać do robots.txt?
To opcjonalne, ale wygodne: wiersz Sitemap: https://example.com/sitemap.xml pomaga każdej wyszukiwarce ją znaleźć. Adres musi być pełny, z https:// i domeną.
Dlaczego zablokowana strona i tak jest w Google?
robots.txt blokuje tylko pobieranie. Jeśli inne strony linkują do adresu, Google może go pokazać bez opisu. Aby usunąć go z indeksu, użyj noindex i pozwól na skanowanie.
Źródła i podstawa prawna
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Stan na:
Podobne narzędzia
- Generator sitemap XML: utwórz plik sitemap.xml z listy adresówGenerator sitemap XML bez rejestracji: wklej adresy URL, otrzymaj poprawny plik sitemap.xml zgodny z protokołem Sitemaps, sprawdź błędy i pobierz. Online.
- Audyt SEO strony online za darmoDarmowy audyt SEO dowolnego adresu: title, meta description, H1, canonical, hreflang, noindex, Open Graph, dane strukturalne i alt – z oceną i wskazówkami.
- Sprawdź przekierowanie adresu URLSprawdź przekierowanie online: każdy krok adresu URL z kodem (301, 302, 307, 308), celem i czasem. Wykrywa łańcuchy, pętle i błędy HTTPS.
- Sprawdź nagłówki HTTP i bezpieczeństwo stronyZobacz wszystkie nagłówki HTTP adresu URL i oceń nagłówki bezpieczeństwa: HSTS, Content-Security-Policy, X-Frame-Options i Referrer-Policy – ocena od A do F.
- Kody HTTPKody HTTP wyjaśnione: znaczenie 200, 301, 404, 500 i ponad 40 innych kodów, z wyszukiwaniem po kodzie lub słowie kluczowym oraz filtrem według klasy.
- Algorytm Luhna: walidator i kalkulator cyfry kontrolnejSprawdź numer algorytmem Luhna (mod 10, ISO/IEC 7812-1) albo oblicz cyfrę kontrolną – tylko kontrola formatu, obliczenia działają lokalnie w przeglądarce.