robots.txt checker met sitemapcontrole
Vul de URL van een pagina in en deze robots.txt checker laat zien of Googlebot, Bingbot en AI-crawlers zoals GPTBot of ClaudeBot hem mogen ophalen – plus de regel die de doorslag geeft. Daarnaast meldt hij syntaxfouten en controleert hij de sitemap: aantal URL’s, andere hosts en lastmod-formaat.
Bron: RFC 9309 – Robots Exclusion Protocol. Bijgewerkt: .
Zo wordt het berekend
Zo lezen crawlers de robots.txt
Het bestand staat altijd in de hoofdmap van een host (https://example.com/robots.txt) en geldt alleen voor die host en dat protocol. Sinds 2022 is het formaat vastgelegd in RFC 9309:
- Groepen: een of meer
User-agent-regels, gevolgd doorAllow- enDisallow-regels. Een crawler volgt alleen de groep met zijn eigen naam; is die er niet, dan geldtUser-agent: *. - De langste regel wint: met
Disallow: /shopenAllow: /shop/aanbiedingenis /shop/aanbiedingen/1 toegestaan. Bij gelijke lengte wint Allow. - Jokertekens:
*staat voor willekeurige tekens,$voor het einde van de URL:Disallow: /*.pdf$blokkeert alle pdf’s. - Geen bestand (404): alles mag gecrawld worden. Bij een 5xx-fout pauzeert Google het crawlen.
Google leest alleen user-agent, allow, disallow en sitemap, en hooguit 500 KiB. Crawl-delay en Noindex negeert Google – de checker wijst je daarop.
Crawlen blokkeren is niet hetzelfde als niet indexeren
Een geblokkeerde URL kan toch in de zoekresultaten verschijnen als andere pagina’s ernaar linken, alleen zonder beschrijving. Wil je een pagina echt uit de index houden, gebruik dan noindex (metatag of X-Robots-Tag) en laat hem crawlbaar, anders ziet Google de noindex nooit.
AI-crawlers en sitemap
De checker test ook GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (gebruik voor Googles AI-modellen) en CCBot (Common Crawl): een groep User-agent: GPTBot met Disallow: / volstaat om er één te weren. Daarna controleert hij de eerste sitemap uit robots.txt of anders /sitemap.xml: hooguit 50.000 URL’s en 50 MB, één host en lastmod in W3C-formaat. Een nieuwe sitemap maak je met de sitemap-XML-generator. Ingepakte sitemaps (.xml.gz) worden niet uitgepakt en grote bestanden worden tot 2 MB gelezen.
Veelgestelde vragen
Hoe test ik mijn robots.txt?
Vul het adres van een pagina op je site in en klik op ‘robots.txt controleren’. De tabel toont voor Googlebot, Bingbot, AI-crawlers en alle andere crawlers of precies die URL is toegestaan en welke regel beslist. Google heeft ook een robots.txt-rapport in Search Console.
Wat betekent ‘Disallow: /’?
De schuine streep staat voor alle paden: de crawlers in die groep mogen niets ophalen. Onder User-agent: * is de hele site voor iedereen geblokkeerd – alleen zinvol bij test- of stagingomgevingen.
Hoe laat ik in robots.txt alles toe?
Met een groep User-agent: * zonder Disallow-regels, of met een lege Disallow-regel. Ook helemaal geen bestand (404) betekent dat alles is toegestaan.
Moet de sitemap in robots.txt staan?
Het is optioneel maar handig: een regel als Sitemap: https://example.com/sitemap.xml helpt elke zoekmachine hem te vinden. De URL moet volledig zijn, met https:// en domein.
Waarom staat mijn geblokkeerde pagina toch in Google?
robots.txt voorkomt alleen het ophalen. Linken andere pagina’s naar de URL, dan kan Google hem zonder beschrijving tonen. Om hem uit de index te halen gebruik je noindex en sta je het crawlen toe.
Bronnen en wettelijke basis
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Bijgewerkt op:
Vergelijkbare tools
- Sitemap XML generator: maak sitemap.xml van je URL-lijstSitemap XML generator zonder account: plak URL’s, krijg een geldige sitemap.xml volgens het Sitemaps-protocol, controleer fouten en download. In je browser.
- SEO checker: webpagina gratis analyserenSEO checker voor elke URL: title, meta description, H1, canonical, hreflang, noindex, Open Graph, gestructureerde data en alt – met score en concrete tips.
- Redirect checker: bekijk de hele redirectketenDeze redirect checker toont elke stap van een URL met statuscode (301, 302, 307, 308), doel en tijd – en waarschuwt voor ketens, lussen en HTTPS-fouten.
- HTTP header checker met beveiligingscijferBekijk alle HTTP-headers van een URL en beoordeel de security headers: HSTS, Content-Security-Policy, X-Frame-Options en Referrer-Policy – cijfer A tot F.
- HTTP-statuscodesHTTP-statuscodes opzoeken: de betekenis van 200, 301, 404, 500 en ruim 40 andere codes uitgelegd, met zoeken op code of trefwoord en filter op klasse.
- ASCII-tabel met decimaal, hex, octaal, binair en Unicode-zoekerVolledige ASCII-tabel (0–127) en Latin-1 (128–255) met decimaal, hex, octaal, binair, HTML-entiteit en stuurtekens. Zoek elk Unicode-teken op, inclusief UTF-8.