robots.txt checker con controllo della sitemap

Questo robots.txt checker ti dice, per l’URL che inserisci, se Googlebot, Bingbot e i crawler di IA come GPTBot o ClaudeBot possono scansionarlo e quale regola decide. Segnala inoltre errori di sintassi e controlla la sitemap: numero di URL, host estranei e formato di lastmod.

Fonte: RFC 9309 – Robots Exclusion Protocol. Aggiornato al: .

I miei strumenti

Al clic il browser invia l’URL inserito al nostro server (Cloudflare Worker), che scarica la pagina come «ToolboxDayBot», rispetta il suo robots.txt e restituisce solo l’analisi. URL e indirizzo IP non vengono salvati; per il limite di 30 controlli all’ora il server tiene in memoria, al massimo per un’ora, un hash non reversibile del tuo IP.

Risultato

Risultato
–
Scansione consentita?
Controlli
Consigli
Regole del robots.txt
Estratto della sitemap

Come si calcola

Come i crawler leggono il robots.txt

Il file sta sempre nella radice dell’host (https://example.com/robots.txt) e vale solo per quell’host e quel protocollo. Dal 2022 il formato è standardizzato nella RFC 9309:

Google legge solo user-agent, allow, disallow e sitemap, e al massimo 500 KiB. Crawl-delay e Noindex vengono ignorati da Google: il checker lo segnala.

Bloccare la scansione non impedisce l’indicizzazione

Un URL bloccato può comparire nei risultati se altre pagine lo linkano, solo senza descrizione. Per toglierlo dall’indice usa noindex (meta tag o X-Robots-Tag) e lascialo scansionabile, altrimenti Google non vedrà mai il noindex.

Crawler di IA e sitemap

Il checker verifica anche GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (uso per i modelli di IA di Google) e CCBot (Common Crawl): un gruppo User-agent: GPTBot con Disallow: / basta per escluderne uno. Poi controlla la prima sitemap indicata nel robots.txt o, in mancanza, /sitemap.xml: al massimo 50.000 URL e 50 MB, un solo host e lastmod in formato W3C. Per crearne una nuova c’è il generatore di sitemap XML. Le sitemap compresse (.xml.gz) non vengono decompresse e i file grandi sono letti fino a 2 MB.

Domande frequenti

Come posso testare il mio robots.txt?

Inserisci l’indirizzo di una pagina del sito e clicca su «Controlla robots.txt». La tabella mostra per Googlebot, Bingbot, i crawler di IA e tutti gli altri se quell’URL è consentito e quale regola decide. Google offre anche un rapporto robots.txt in Search Console.

Robots.txt: cos’è?

Un file di testo nella radice del sito che indica ai crawler quali aree possono visitare. Non protegge nulla: i bot malevoli lo ignorano e non sostituisce una password.

Cosa significa «Disallow: /»?

La barra indica tutti i percorsi: i crawler di quel gruppo non possono scaricare nulla. Sotto User-agent: * blocca l’intero sito per tutti, cosa sensata solo in ambienti di test.

Come si scrive un robots.txt che consente tutto?

Basta un gruppo User-agent: * senza regole Disallow, oppure con una riga Disallow vuota. Anche nessun file (errore 404) significa che è tutto consentito.

Perché la mia pagina bloccata compare su Google?

Il robots.txt impedisce solo il download. Se altre pagine linkano l’URL, Google può mostrarlo senza descrizione. Per rimuoverlo dall’indice usa noindex e consenti la scansione.

Fonti e riferimenti normativi

Aggiornato al:

Strumenti correlati