Validador robots.txt com checagem do sitemap

Este validador robots.txt diz, para a URL que você digitar, se Googlebot, Bingbot e robôs de IA como GPTBot ou ClaudeBot podem rastreá-la – e qual regra decide. Ele também aponta erros de sintaxe e confere o sitemap: quantidade de URLs, hosts de fora e formato do lastmod.

Fonte: RFC 9309 – Robots Exclusion Protocol. Atualizado em: .

Ao clicar, seu navegador envia a URL digitada ao nosso servidor (Cloudflare Worker). Ele baixa a página como “ToolboxDayBot”, respeita o robots.txt dela e devolve só a análise. A URL e o endereço IP não são armazenados; para o limite de 30 verificações por hora, o servidor mantém na memória, por no máximo uma hora, um hash irreversível do seu IP.

Resultado

Resultado
–
Pode rastrear?
Verificações
Dicas
Regras do robots.txt
Amostra do sitemap

Como o cálculo é feito

Como os robôs leem o robots.txt

O arquivo fica sempre na raiz do host (https://example.com/robots.txt) e vale só para esse host e esse protocolo. Desde 2022 o formato é padronizado pela RFC 9309:

O Google só lê user-agent, allow, disallow e sitemap, e no máximo 500 KiB. Crawl-delay e Noindex são ignorados pelo Google – o validador avisa.

Bloquear o rastreamento não impede a indexação

Uma URL bloqueada pode aparecer nos resultados se outras páginas apontarem para ela, só que sem descrição. Para tirá-la do índice, use noindex (meta tag ou X-Robots-Tag) e deixe a página rastreável – senão o Google nunca vê o noindex.

Robôs de IA e sitemap

O validador também testa GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (uso nos modelos de IA do Google) e CCBot (Common Crawl): um grupo User-agent: GPTBot com Disallow: / basta para bloquear um deles. Depois ele confere o primeiro sitemap citado no robots.txt ou, se não houver, /sitemap.xml: no máximo 50.000 URLs e 50 MB, um só host e lastmod no formato W3C. Para criar um novo, use o gerador de sitemap XML. Sitemaps compactados (.xml.gz) não são descompactados e arquivos grandes são lidos até 2 MB.

Perguntas frequentes

Como testar meu arquivo robots.txt?

Digite o endereço de uma página do seu site e clique em “Validar robots.txt”. A tabela mostra, para Googlebot, Bingbot, robôs de IA e os demais, se aquela URL específica é permitida e qual regra decide. O Google também tem um relatório de robots.txt no Search Console.

Robots.txt: o que é?

É um arquivo de texto na raiz do site que diz aos robôs de busca quais áreas eles podem percorrer. Ele não protege nada: robôs mal-intencionados o ignoram, e ele não substitui uma senha.

O que significa “Disallow: /”?

A barra representa todos os caminhos: os robôs daquele grupo não podem baixar nada. Sob User-agent: *, o site inteiro fica bloqueado para todos – só faz sentido em ambientes de teste.

Preciso colocar o sitemap no robots.txt?

É opcional, mas prático: uma linha como Sitemap: https://example.com/sitemap.xml ajuda todos os buscadores a encontrá-lo. A URL deve ser completa, com https:// e domínio.

Por que minha página bloqueada aparece no Google?

O robots.txt só impede o download. Se outras páginas linkam a URL, o Google pode listá-la sem descrição. Para removê-la do índice, use noindex e permita o rastreamento.

Fontes e base legal

Última atualização:

Ferramentas relacionadas