robots.txt checker con controllo della sitemap
Questo robots.txt checker ti dice, per l’URL che inserisci, se Googlebot, Bingbot e i crawler di IA come GPTBot o ClaudeBot possono scansionarlo e quale regola decide. Segnala inoltre errori di sintassi e controlla la sitemap: numero di URL, host estranei e formato di lastmod.
Fonte: RFC 9309 – Robots Exclusion Protocol. Aggiornato al: .
Come si calcola
Come i crawler leggono il robots.txt
Il file sta sempre nella radice dell’host (https://example.com/robots.txt) e vale solo per quell’host e quel protocollo. Dal 2022 il formato è standardizzato nella RFC 9309:
- Gruppi: una o più righe
User-agent, seguite da regoleAlloweDisallow. Ogni crawler segue solo il gruppo con il suo nome; se manca, vale il gruppoUser-agent: *. - Vince la regola più lunga: con
Disallow: /negozioeAllow: /negozio/offerte, /negozio/offerte/1 è consentito. A parità vince Allow. - Caratteri jolly:
*vale qualsiasi sequenza di caratteri,$indica la fine dell’URL:Disallow: /*.pdf$blocca tutti i PDF. - File assente (404): si può scansionare tutto. Con un errore 5xx Google sospende la scansione.
Google legge solo user-agent, allow, disallow e sitemap, e al massimo 500 KiB. Crawl-delay e Noindex vengono ignorati da Google: il checker lo segnala.
Bloccare la scansione non impedisce l’indicizzazione
Un URL bloccato può comparire nei risultati se altre pagine lo linkano, solo senza descrizione. Per toglierlo dall’indice usa noindex (meta tag o X-Robots-Tag) e lascialo scansionabile, altrimenti Google non vedrà mai il noindex.
Crawler di IA e sitemap
Il checker verifica anche GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (uso per i modelli di IA di Google) e CCBot (Common Crawl): un gruppo User-agent: GPTBot con Disallow: / basta per escluderne uno. Poi controlla la prima sitemap indicata nel robots.txt o, in mancanza, /sitemap.xml: al massimo 50.000 URL e 50 MB, un solo host e lastmod in formato W3C. Per crearne una nuova c’è il generatore di sitemap XML. Le sitemap compresse (.xml.gz) non vengono decompresse e i file grandi sono letti fino a 2 MB.
Domande frequenti
Come posso testare il mio robots.txt?
Inserisci l’indirizzo di una pagina del sito e clicca su «Controlla robots.txt». La tabella mostra per Googlebot, Bingbot, i crawler di IA e tutti gli altri se quell’URL è consentito e quale regola decide. Google offre anche un rapporto robots.txt in Search Console.
Robots.txt: cos’è?
Un file di testo nella radice del sito che indica ai crawler quali aree possono visitare. Non protegge nulla: i bot malevoli lo ignorano e non sostituisce una password.
Cosa significa «Disallow: /»?
La barra indica tutti i percorsi: i crawler di quel gruppo non possono scaricare nulla. Sotto User-agent: * blocca l’intero sito per tutti, cosa sensata solo in ambienti di test.
Come si scrive un robots.txt che consente tutto?
Basta un gruppo User-agent: * senza regole Disallow, oppure con una riga Disallow vuota. Anche nessun file (errore 404) significa che è tutto consentito.
Perché la mia pagina bloccata compare su Google?
Il robots.txt impedisce solo il download. Se altre pagine linkano l’URL, Google può mostrarlo senza descrizione. Per rimuoverlo dall’indice usa noindex e consenti la scansione.
Fonti e riferimenti normativi
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Aggiornato al:
Strumenti correlati
- Generatore sitemap XML: crea sitemap.xml dai tuoi URLGeneratore sitemap XML senza registrazione: incolla gli URL, ottieni un sitemap.xml valido secondo il protocollo Sitemaps, controlla gli errori e scaricalo.
- Analisi SEO gratis di una pagina webAnalisi SEO online di un URL: title, meta description, H1, canonical, hreflang, noindex, Open Graph, dati strutturati e alt – con punteggio e consigli pratici.
- Verifica redirect di un URLVerifica redirect online: ogni passaggio di un URL con codice (301, 302, 307, 308), destinazione e tempo. Segnala catene, loop ed errori HTTPS.
- Verifica degli header HTTP di un sitoMostra ogni header HTTP di un URL e valuta quelli di sicurezza: HSTS, Content-Security-Policy, X-Frame-Options e Referrer-Policy, con voto da A a F e consigli.
- Codici HTTPCodici HTTP spiegati: significato di 200, 301, 404, 500 e di oltre 40 altri codici, con ricerca per codice o parola chiave e filtro per classe.
- Abbinamento font: coppie per titoli e testoCoppie di font per titoli e testo con anteprima live, CSS pronto da copiare e disponibilità su Windows, Mac, iPhone e Android – solo font di sistema.