Validador robots.txt com checagem do sitemap
Este validador robots.txt diz, para a URL que você digitar, se Googlebot, Bingbot e robôs de IA como GPTBot ou ClaudeBot podem rastreá-la – e qual regra decide. Ele também aponta erros de sintaxe e confere o sitemap: quantidade de URLs, hosts de fora e formato do lastmod.
Fonte: RFC 9309 – Robots Exclusion Protocol. Atualizado em: .
Como o cálculo é feito
Como os robôs leem o robots.txt
O arquivo fica sempre na raiz do host (https://example.com/robots.txt) e vale só para esse host e esse protocolo. Desde 2022 o formato é padronizado pela RFC 9309:
- Grupos: uma ou mais linhas
User-agent, seguidas de regrasAlloweDisallow. Cada robô segue apenas o grupo com o seu nome; se não houver, vale o grupoUser-agent: *. - Vence a regra mais longa: com
Disallow: /lojaeAllow: /loja/ofertas, /loja/ofertas/1 fica liberado. Em empate, vence Allow. - Curingas:
*vale qualquer sequência de caracteres e$marca o fim da URL:Disallow: /*.pdf$bloqueia todos os PDFs. - Sem arquivo (404), tudo pode ser rastreado. Com erro 5xx, o Google pausa o rastreamento.
O Google só lê user-agent, allow, disallow e sitemap, e no máximo 500 KiB. Crawl-delay e Noindex são ignorados pelo Google – o validador avisa.
Bloquear o rastreamento não impede a indexação
Uma URL bloqueada pode aparecer nos resultados se outras páginas apontarem para ela, só que sem descrição. Para tirá-la do índice, use noindex (meta tag ou X-Robots-Tag) e deixe a página rastreável – senão o Google nunca vê o noindex.
Robôs de IA e sitemap
O validador também testa GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (uso nos modelos de IA do Google) e CCBot (Common Crawl): um grupo User-agent: GPTBot com Disallow: / basta para bloquear um deles. Depois ele confere o primeiro sitemap citado no robots.txt ou, se não houver, /sitemap.xml: no máximo 50.000 URLs e 50 MB, um só host e lastmod no formato W3C. Para criar um novo, use o gerador de sitemap XML. Sitemaps compactados (.xml.gz) não são descompactados e arquivos grandes são lidos até 2 MB.
Perguntas frequentes
Como testar meu arquivo robots.txt?
Digite o endereço de uma página do seu site e clique em “Validar robots.txt”. A tabela mostra, para Googlebot, Bingbot, robôs de IA e os demais, se aquela URL específica é permitida e qual regra decide. O Google também tem um relatório de robots.txt no Search Console.
Robots.txt: o que é?
É um arquivo de texto na raiz do site que diz aos robôs de busca quais áreas eles podem percorrer. Ele não protege nada: robôs mal-intencionados o ignoram, e ele não substitui uma senha.
O que significa “Disallow: /”?
A barra representa todos os caminhos: os robôs daquele grupo não podem baixar nada. Sob User-agent: *, o site inteiro fica bloqueado para todos – só faz sentido em ambientes de teste.
Preciso colocar o sitemap no robots.txt?
É opcional, mas prático: uma linha como Sitemap: https://example.com/sitemap.xml ajuda todos os buscadores a encontrá-lo. A URL deve ser completa, com https:// e domínio.
Por que minha página bloqueada aparece no Google?
O robots.txt só impede o download. Se outras páginas linkam a URL, o Google pode listá-la sem descrição. Para removê-la do índice, use noindex e permita o rastreamento.
Fontes e base legal
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Última atualização:
Ferramentas relacionadas
- Gerador de sitemap XML: crie o sitemap.xml a partir de URLsGerador de sitemap XML sem cadastro: cole as URLs, receba um sitemap.xml válido pelo protocolo Sitemaps, confira erros e baixe. Funciona no navegador.
- Análise de SEO grátis de uma páginaAnálise de SEO online de qualquer URL: title, meta description, H1, canonical, hreflang, noindex, Open Graph, dados estruturados e alt – com nota e dicas.
- Verificar redirecionamento de uma URLVerificar redirecionamento online: cada etapa de uma URL com o código (301, 302, 307, 308), destino e tempo. Mostra cadeias, loops e erros de HTTPS.
- Verificar cabeçalho HTTP e segurançaVeja todo cabeçalho HTTP de uma URL e avalie os headers de segurança: HSTS, Content-Security-Policy, X-Frame-Options e Referrer-Policy, com nota de A a F.
- Códigos de status HTTPCódigos de status HTTP explicados: significado de 200, 301, 404, 500 e de mais de 40 códigos, com busca por código ou palavra-chave e filtro por classe.
- Algoritmo de Luhn: validar e calcular um dígitoValide números com o algoritmo de Luhn (módulo 10, ISO/IEC 7812-1) ou calcule o dígito verificador – só confere o formato, direto no navegador.