Validador robots.txt con revisión del sitemap
Este validador robots.txt te dice, para la URL que escribas, si Googlebot, Bingbot y los bots de IA como GPTBot o ClaudeBot pueden rastrearla, y qué regla lo decide. Además señala errores de sintaxis y revisa el sitemap: número de URL, hosts ajenos y formato de lastmod.
Fuente: RFC 9309 – Robots Exclusion Protocol. Actualizado: .
Cómo se calcula
Cómo leen los rastreadores el robots.txt
El archivo está siempre en la raíz del host (https://example.com/robots.txt) y solo vale para ese host y ese protocolo. Desde 2022 su formato está estandarizado en el RFC 9309:
- Grupos: una o varias líneas
User-agentseguidas de reglasAllowyDisallow. Cada rastreador sigue solo el grupo con su nombre; si no existe, el grupoUser-agent: *. - Gana la regla más larga: con
Disallow: /tiendayAllow: /tienda/ofertas, /tienda/ofertas/1 está permitido. En empate gana Allow. - Comodines:
*equivale a cualquier secuencia de caracteres y$marca el final de la URL:Disallow: /*.pdf$bloquea todos los PDF. - Sin archivo (404) se puede rastrear todo. Con un error 5xx, Google detiene el rastreo.
Google solo lee user-agent, allow, disallow y sitemap, y como máximo 500 KiB. Crawl-delay y Noindex no los tiene en cuenta; el validador lo indica.
Bloquear el rastreo no impide la indexación
Una URL bloqueada puede salir en los resultados si otras páginas la enlazan, solo que sin descripción. Para sacarla del índice usa noindex (meta etiqueta o X-Robots-Tag) y deja que se rastree; si no, Google nunca verá ese noindex.
Bots de IA y sitemap
El validador comprueba también GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (uso para los modelos de IA de Google) y CCBot (Common Crawl): un grupo User-agent: GPTBot con Disallow: / basta para excluir uno. Después revisa el primer sitemap indicado en el robots.txt o, si no hay ninguno, /sitemap.xml: 50.000 URL y 50 MB como máximo, un solo host y lastmod en formato W3C. Si necesitas uno nuevo, prueba el generador de sitemap XML. Los sitemaps comprimidos (.xml.gz) no se descomprimen y los archivos grandes se leen hasta 2 MB.
Preguntas frecuentes
¿Cómo puedo probar mi archivo robots.txt?
Escribe la dirección de una página de tu web y pulsa «Validar robots.txt». La tabla indica para Googlebot, Bingbot, los bots de IA y el resto si esa URL concreta está permitida y qué regla decide. Google también ofrece un informe de robots.txt en Search Console.
¿Qué es el robots.txt?
Un archivo de texto en la raíz del sitio que indica a los rastreadores qué zonas pueden recorrer. No protege nada: los bots maliciosos lo ignoran y no sustituye a una contraseña.
¿Qué significa «Disallow: /»?
La barra representa todas las rutas: los rastreadores de ese grupo no pueden descargar nada. Bajo User-agent: * bloquea la web entera para todos, algo que solo tiene sentido en entornos de prueba.
¿Hay que poner el sitemap en el robots.txt?
Es opcional pero práctico: una línea como Sitemap: https://example.com/sitemap.xml ayuda a todos los buscadores a encontrarlo. La URL debe ser completa, con https:// y dominio.
¿Por qué mi página bloqueada aparece en Google?
El robots.txt solo impide la descarga. Si otras páginas enlazan la URL, Google puede mostrarla sin descripción. Para quitarla del índice, usa noindex y permite el rastreo.
Fuentes y base legal
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Última actualización:
Herramientas relacionadas
- Generador de sitemap XML: crea sitemap.xml desde tus URLGenerador de sitemap XML sin registro: pega tus URL, obtén un sitemap.xml válido según el protocolo Sitemaps, revisa errores y descárgalo. En tu navegador.
- Análisis SEO gratis de una página webAnálisis SEO online de cualquier URL: title, meta description, H1, canonical, hreflang, noindex, Open Graph, datos estructurados y alt, con nota y consejos.
- Comprobar redirecciones de una URLComprobar redirecciones online: cada salto de una URL con su código (301, 302, 307, 308), destino y tiempo. Detecta cadenas, bucles y errores de HTTPS.
- Comprobar cabeceras HTTP y su seguridadVer las cabeceras HTTP de una URL y analizar las de seguridad: HSTS, Content-Security-Policy, X-Frame-Options y Referrer-Policy, con nota de la A a la F.
- Códigos de estado HTTPCódigos de estado HTTP explicados: significado de 200, 301, 404, 500 y más de 40 códigos, con búsqueda por código o palabra clave y filtro por clase.
- Cuál es mi dirección IPMuestra al instante tu dirección IP pública, detecta si es IPv4 o IPv6 y explica la diferencia. Gratis: tu IP no se guarda.