robots.txt tester ze sprawdzeniem mapy witryny

Ten robots.txt tester pokazuje dla wpisanego adresu, czy Googlebot, Bingbot i roboty AI, takie jak GPTBot czy ClaudeBot, mogą go pobrać – i która reguła o tym decyduje. Wskazuje też błędy składni i sprawdza mapę witryny: liczbę adresów, obce hosty i format lastmod.

Źródło: RFC 9309 – Robots Exclusion Protocol. Stan na: .

Moje narzędzia

Po kliknięciu przeglądarka wysyła wpisany adres URL do naszego serwera (Cloudflare Worker). Serwer pobiera stronę jako „ToolboxDayBot”, przestrzega jej robots.txt i odsyła wyłącznie wynik analizy. Nie zapisujemy ani adresu URL, ani adresu IP; na potrzeby limitu 30 sprawdzeń na godzinę serwer przechowuje w pamięci operacyjnej, najwyżej przez godzinę, nieodwracalny skrót (hash) Twojego IP.

Wynik

Wynik
–
Czy wolno skanować?
Sprawdzone elementy
Wskazówki
Reguły robots.txt
Fragment mapy witryny

Jak to obliczamy

Jak roboty czytają robots.txt

Plik leży zawsze w katalogu głównym hosta (https://example.com/robots.txt) i dotyczy tylko tego hosta i protokołu. Od 2022 roku jego format opisuje standard RFC 9309:

Google czyta tylko user-agent, allow, disallow i sitemap, najwyżej 500 KiB. Crawl-delay i Noindex Google ignoruje – tester o tym informuje.

Blokada skanowania to nie blokada indeksowania

Zablokowany adres może pojawić się w wynikach, jeśli linkują do niego inne strony – tylko bez opisu. Aby usunąć stronę z indeksu, użyj noindex (meta tag lub X-Robots-Tag) i pozwól ją skanować, inaczej Google nigdy nie zobaczy noindex.

Roboty AI i mapa witryny

Tester sprawdza też GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (wykorzystanie w modelach AI Google) i CCBot (Common Crawl): grupa User-agent: GPTBot z Disallow: / wystarczy, by zablokować jednego z nich. Następnie sprawdza pierwszą mapę witryny z robots.txt, a gdy jej brak – /sitemap.xml: maksymalnie 50 000 adresów i 50 MB, jeden host i lastmod w formacie W3C. Nową mapę utworzysz w generatorze sitemap XML. Mapy spakowane (.xml.gz) nie są rozpakowywane, a duże pliki czytamy do 2 MB.

Najczęściej zadawane pytania

Jak przetestować plik robots.txt?

Wpisz adres strony ze swojej witryny i kliknij „Sprawdź robots.txt”. Tabela pokaże dla Googlebota, Bingbota, robotów AI i pozostałych, czy ten konkretny adres jest dozwolony i która reguła decyduje. Google udostępnia też raport robots.txt w Search Console.

Robots.txt – co to jest?

To plik tekstowy w katalogu głównym witryny, który mówi robotom wyszukiwarek, które obszary mogą przeglądać. Niczego nie zabezpiecza: złośliwe boty go ignorują i nie zastępuje hasła.

Co oznacza „Disallow: /”?

Ukośnik oznacza wszystkie ścieżki: roboty z tej grupy nie mogą niczego pobrać. Pod User-agent: * blokuje całą witrynę dla wszystkich – sensowne tylko w środowiskach testowych.

Czy mapę witryny trzeba wpisać do robots.txt?

To opcjonalne, ale wygodne: wiersz Sitemap: https://example.com/sitemap.xml pomaga każdej wyszukiwarce ją znaleźć. Adres musi być pełny, z https:// i domeną.

Dlaczego zablokowana strona i tak jest w Google?

robots.txt blokuje tylko pobieranie. Jeśli inne strony linkują do adresu, Google może go pokazać bez opisu. Aby usunąć go z indeksu, użyj noindex i pozwól na skanowanie.

Źródła i podstawa prawna

Stan na:

Podobne narzędzia