Validador robots.txt con revisión del sitemap

Este validador robots.txt te dice, para la URL que escribas, si Googlebot, Bingbot y los bots de IA como GPTBot o ClaudeBot pueden rastrearla, y qué regla lo decide. Además señala errores de sintaxis y revisa el sitemap: número de URL, hosts ajenos y formato de lastmod.

Fuente: RFC 9309 – Robots Exclusion Protocol. Actualizado: .

Al pulsar, tu navegador envía la URL introducida a nuestro servidor (Cloudflare Worker). Este descarga la página como «ToolboxDayBot», respeta su robots.txt y devuelve solo el análisis. No guardamos ni la URL ni la dirección IP; para el límite de 30 comprobaciones por hora, el servidor conserva en memoria, como máximo una hora, un hash irreversible de tu IP.

Resultado

Resultado
–
¿Se puede rastrear?
Comprobaciones
Consejos
Reglas del robots.txt
Muestra del sitemap

Cómo se calcula

Cómo leen los rastreadores el robots.txt

El archivo está siempre en la raíz del host (https://example.com/robots.txt) y solo vale para ese host y ese protocolo. Desde 2022 su formato está estandarizado en el RFC 9309:

Google solo lee user-agent, allow, disallow y sitemap, y como máximo 500 KiB. Crawl-delay y Noindex no los tiene en cuenta; el validador lo indica.

Bloquear el rastreo no impide la indexación

Una URL bloqueada puede salir en los resultados si otras páginas la enlazan, solo que sin descripción. Para sacarla del índice usa noindex (meta etiqueta o X-Robots-Tag) y deja que se rastree; si no, Google nunca verá ese noindex.

Bots de IA y sitemap

El validador comprueba también GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (uso para los modelos de IA de Google) y CCBot (Common Crawl): un grupo User-agent: GPTBot con Disallow: / basta para excluir uno. Después revisa el primer sitemap indicado en el robots.txt o, si no hay ninguno, /sitemap.xml: 50.000 URL y 50 MB como máximo, un solo host y lastmod en formato W3C. Si necesitas uno nuevo, prueba el generador de sitemap XML. Los sitemaps comprimidos (.xml.gz) no se descomprimen y los archivos grandes se leen hasta 2 MB.

Preguntas frecuentes

¿Cómo puedo probar mi archivo robots.txt?

Escribe la dirección de una página de tu web y pulsa «Validar robots.txt». La tabla indica para Googlebot, Bingbot, los bots de IA y el resto si esa URL concreta está permitida y qué regla decide. Google también ofrece un informe de robots.txt en Search Console.

¿Qué es el robots.txt?

Un archivo de texto en la raíz del sitio que indica a los rastreadores qué zonas pueden recorrer. No protege nada: los bots maliciosos lo ignoran y no sustituye a una contraseña.

¿Qué significa «Disallow: /»?

La barra representa todas las rutas: los rastreadores de ese grupo no pueden descargar nada. Bajo User-agent: * bloquea la web entera para todos, algo que solo tiene sentido en entornos de prueba.

¿Hay que poner el sitemap en el robots.txt?

Es opcional pero práctico: una línea como Sitemap: https://example.com/sitemap.xml ayuda a todos los buscadores a encontrarlo. La URL debe ser completa, con https:// y dominio.

¿Por qué mi página bloqueada aparece en Google?

El robots.txt solo impide la descarga. Si otras páginas enlazan la URL, Google puede mostrarla sin descripción. Para quitarla del índice, usa noindex y permite el rastreo.

Fuentes y base legal

Última actualización:

Herramientas relacionadas