robots.txt checker met sitemapcontrole

Vul de URL van een pagina in en deze robots.txt checker laat zien of Googlebot, Bingbot en AI-crawlers zoals GPTBot of ClaudeBot hem mogen ophalen – plus de regel die de doorslag geeft. Daarnaast meldt hij syntaxfouten en controleert hij de sitemap: aantal URL’s, andere hosts en lastmod-formaat.

Bron: RFC 9309 – Robots Exclusion Protocol. Bijgewerkt: .

Mijn toolbox

Na je klik stuurt je browser de ingevulde URL naar onze server (Cloudflare Worker). Die haalt de pagina op als ‘ToolboxDayBot’, respecteert de robots.txt en stuurt alleen de analyse terug. URL en IP-adres worden niet opgeslagen; voor de limiet van 30 controles per uur houdt de server hoogstens een uur lang een niet-terug te rekenen hash van je IP in het werkgeheugen.

Resultaat

Resultaat
–
Mag gecrawld worden?
Controles
Tips
Regels in robots.txt
Uittreksel sitemap

Zo wordt het berekend

Zo lezen crawlers de robots.txt

Het bestand staat altijd in de hoofdmap van een host (https://example.com/robots.txt) en geldt alleen voor die host en dat protocol. Sinds 2022 is het formaat vastgelegd in RFC 9309:

Google leest alleen user-agent, allow, disallow en sitemap, en hooguit 500 KiB. Crawl-delay en Noindex negeert Google – de checker wijst je daarop.

Crawlen blokkeren is niet hetzelfde als niet indexeren

Een geblokkeerde URL kan toch in de zoekresultaten verschijnen als andere pagina’s ernaar linken, alleen zonder beschrijving. Wil je een pagina echt uit de index houden, gebruik dan noindex (metatag of X-Robots-Tag) en laat hem crawlbaar, anders ziet Google de noindex nooit.

AI-crawlers en sitemap

De checker test ook GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (gebruik voor Googles AI-modellen) en CCBot (Common Crawl): een groep User-agent: GPTBot met Disallow: / volstaat om er één te weren. Daarna controleert hij de eerste sitemap uit robots.txt of anders /sitemap.xml: hooguit 50.000 URL’s en 50 MB, één host en lastmod in W3C-formaat. Een nieuwe sitemap maak je met de sitemap-XML-generator. Ingepakte sitemaps (.xml.gz) worden niet uitgepakt en grote bestanden worden tot 2 MB gelezen.

Veelgestelde vragen

Hoe test ik mijn robots.txt?

Vul het adres van een pagina op je site in en klik op ‘robots.txt controleren’. De tabel toont voor Googlebot, Bingbot, AI-crawlers en alle andere crawlers of precies die URL is toegestaan en welke regel beslist. Google heeft ook een robots.txt-rapport in Search Console.

Wat betekent ‘Disallow: /’?

De schuine streep staat voor alle paden: de crawlers in die groep mogen niets ophalen. Onder User-agent: * is de hele site voor iedereen geblokkeerd – alleen zinvol bij test- of stagingomgevingen.

Hoe laat ik in robots.txt alles toe?

Met een groep User-agent: * zonder Disallow-regels, of met een lege Disallow-regel. Ook helemaal geen bestand (404) betekent dat alles is toegestaan.

Moet de sitemap in robots.txt staan?

Het is optioneel maar handig: een regel als Sitemap: https://example.com/sitemap.xml helpt elke zoekmachine hem te vinden. De URL moet volledig zijn, met https:// en domein.

Waarom staat mijn geblokkeerde pagina toch in Google?

robots.txt voorkomt alleen het ophalen. Linken andere pagina’s naar de URL, dan kan Google hem zonder beschrijving tonen. Om hem uit de index te halen gebruik je noindex en sta je het crawlen toe.

Bronnen en wettelijke basis

Bijgewerkt op:

Vergelijkbare tools