robots.txt validator dengan cek sitemap

robots.txt validator ini menunjukkan untuk URL yang Anda masukkan apakah Googlebot, Bingbot, dan crawler AI seperti GPTBot atau ClaudeBot boleh mengambilnya – beserta aturan yang menentukan. Alat ini juga menandai kesalahan sintaks dan mengecek sitemap: jumlah URL, host lain, dan format lastmod.

Sumber: RFC 9309 – Robots Exclusion Protocol. Diperbarui: .

Kotak Alat Saya

Saat Anda mengeklik, browser mengirim URL yang dimasukkan ke server kami (Cloudflare Worker). Server mengambil halaman sebagai “ToolboxDayBot”, mematuhi robots.txt situs tersebut, dan hanya mengirim balik hasil analisis. URL dan alamat IP tidak disimpan; untuk batas 30 pengecekan per jam, server menyimpan hash IP Anda yang tidak bisa dibalik di memori paling lama satu jam.

Hasil

Hasil
–
Boleh di-crawl?
Poin pemeriksaan
Saran
Aturan robots.txt
Cuplikan sitemap

Cara menghitung

Cara crawler membaca robots.txt

File ini selalu berada di root host (https://example.com/robots.txt) dan hanya berlaku untuk host dan protokol tersebut. Sejak 2022 formatnya dibakukan dalam RFC 9309:

Google hanya membaca user-agent, allow, disallow, dan sitemap, paling banyak 500 KiB. Crawl-delay dan Noindex diabaikan Google – validator ini memberi tahu Anda.

Memblokir crawling tidak sama dengan memblokir indeks

URL yang diblokir tetap bisa muncul di hasil penelusuran jika halaman lain menautkannya, hanya saja tanpa deskripsi. Agar halaman benar-benar keluar dari indeks, gunakan noindex (meta tag atau X-Robots-Tag) dan biarkan halaman bisa di-crawl; jika diblokir, Google tidak pernah melihat noindex tersebut.

Crawler AI dan sitemap

Validator ini juga menguji GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (pemakaian untuk model AI Google), dan CCBot (Common Crawl): grup User-agent: GPTBot dengan Disallow: / sudah cukup untuk memblokir salah satunya. Setelah itu, sitemap pertama yang disebut di robots.txt – atau /sitemap.xml jika tidak ada – ikut dicek: maksimal 50.000 URL dan 50 MB, satu host saja, dan lastmod berformat W3C. Untuk membuat sitemap baru, pakai pembuat sitemap XML. Sitemap terkompresi (.xml.gz) tidak diekstrak dan file besar dibaca hingga 2 MB.

Pertanyaan umum

robots.txt adalah apa?

File teks di root situs yang memberi tahu crawler mesin pencari bagian mana yang boleh dijelajahi. File ini tidak melindungi apa pun: bot jahat mengabaikannya, dan tidak menggantikan kata sandi.

Bagaimana cara mengecek robots.txt saya?

Masukkan alamat salah satu halaman situs Anda lalu klik “Cek robots.txt”. Tabel menunjukkan untuk Googlebot, Bingbot, crawler AI, dan crawler lain apakah URL itu diizinkan serta aturan mana yang menentukan. Google juga menyediakan laporan robots.txt di Search Console.

Apa arti “Disallow: /”?

Garis miring berarti semua jalur: crawler di grup itu tidak boleh mengambil apa pun. Di bawah User-agent: *, seluruh situs tertutup untuk semua crawler – hanya masuk akal untuk lingkungan uji coba.

Seperti apa contoh robots.txt yang mengizinkan semua?

Cukup grup User-agent: * tanpa aturan Disallow, atau dengan baris Disallow yang kosong. Tidak punya file sama sekali (404) juga berarti semua diizinkan.

Kenapa halaman yang diblokir tetap muncul di Google?

robots.txt hanya mencegah halaman diambil. Jika halaman lain menautkan URL tersebut, Google bisa menampilkannya tanpa deskripsi. Untuk menghapusnya dari indeks, gunakan noindex dan izinkan crawling.

Sumber dan dasar hukum

Diperbarui:

Alat terkait