robots.txt validator dengan cek sitemap
robots.txt validator ini menunjukkan untuk URL yang Anda masukkan apakah Googlebot, Bingbot, dan crawler AI seperti GPTBot atau ClaudeBot boleh mengambilnya – beserta aturan yang menentukan. Alat ini juga menandai kesalahan sintaks dan mengecek sitemap: jumlah URL, host lain, dan format lastmod.
Sumber: RFC 9309 – Robots Exclusion Protocol. Diperbarui: .
Cara menghitung
Cara crawler membaca robots.txt
File ini selalu berada di root host (https://example.com/robots.txt) dan hanya berlaku untuk host dan protokol tersebut. Sejak 2022 formatnya dibakukan dalam RFC 9309:
- Grup: satu atau beberapa baris
User-agent, diikuti aturanAllowdanDisallow. Crawler hanya mengikuti grup dengan namanya sendiri; jika tidak ada, berlaku grupUser-agent: *. - Aturan terpanjang menang: dengan
Disallow: /tokodanAllow: /toko/promo, /toko/promo/1 diizinkan. Jika sama panjang, Allow yang menang. - Wildcard:
*berarti karakter apa saja,$menandai akhir URL:Disallow: /*.pdf$memblokir semua PDF. - Tanpa file (404), semua boleh di-crawl. Saat terjadi error 5xx, Google menghentikan crawling.
Google hanya membaca user-agent, allow, disallow, dan sitemap, paling banyak 500 KiB. Crawl-delay dan Noindex diabaikan Google – validator ini memberi tahu Anda.
Memblokir crawling tidak sama dengan memblokir indeks
URL yang diblokir tetap bisa muncul di hasil penelusuran jika halaman lain menautkannya, hanya saja tanpa deskripsi. Agar halaman benar-benar keluar dari indeks, gunakan noindex (meta tag atau X-Robots-Tag) dan biarkan halaman bisa di-crawl; jika diblokir, Google tidak pernah melihat noindex tersebut.
Crawler AI dan sitemap
Validator ini juga menguji GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (pemakaian untuk model AI Google), dan CCBot (Common Crawl): grup User-agent: GPTBot dengan Disallow: / sudah cukup untuk memblokir salah satunya. Setelah itu, sitemap pertama yang disebut di robots.txt – atau /sitemap.xml jika tidak ada – ikut dicek: maksimal 50.000 URL dan 50 MB, satu host saja, dan lastmod berformat W3C. Untuk membuat sitemap baru, pakai pembuat sitemap XML. Sitemap terkompresi (.xml.gz) tidak diekstrak dan file besar dibaca hingga 2 MB.
Pertanyaan umum
robots.txt adalah apa?
File teks di root situs yang memberi tahu crawler mesin pencari bagian mana yang boleh dijelajahi. File ini tidak melindungi apa pun: bot jahat mengabaikannya, dan tidak menggantikan kata sandi.
Bagaimana cara mengecek robots.txt saya?
Masukkan alamat salah satu halaman situs Anda lalu klik “Cek robots.txt”. Tabel menunjukkan untuk Googlebot, Bingbot, crawler AI, dan crawler lain apakah URL itu diizinkan serta aturan mana yang menentukan. Google juga menyediakan laporan robots.txt di Search Console.
Apa arti “Disallow: /”?
Garis miring berarti semua jalur: crawler di grup itu tidak boleh mengambil apa pun. Di bawah User-agent: *, seluruh situs tertutup untuk semua crawler – hanya masuk akal untuk lingkungan uji coba.
Seperti apa contoh robots.txt yang mengizinkan semua?
Cukup grup User-agent: * tanpa aturan Disallow, atau dengan baris Disallow yang kosong. Tidak punya file sama sekali (404) juga berarti semua diizinkan.
Kenapa halaman yang diblokir tetap muncul di Google?
robots.txt hanya mencegah halaman diambil. Jika halaman lain menautkan URL tersebut, Google bisa menampilkannya tanpa deskripsi. Untuk menghapusnya dari indeks, gunakan noindex dan izinkan crawling.
Sumber dan dasar hukum
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Diperbarui:
Alat terkait
- Pembuat sitemap XML: buat sitemap.xml dari daftar URL AndaPembuat sitemap XML tanpa pendaftaran: tempel URL, dapatkan sitemap.xml valid sesuai protokol Sitemaps, cek kesalahan, lalu unduh. Berjalan di browser Anda.
- Cek SEO website gratis per halamanCek SEO website gratis dari URL: title, meta description, H1, canonical, hreflang, noindex, Open Graph, data terstruktur, alt – lengkap dengan skor dan saran.
- Cek redirect URL langkah demi langkahCek redirect online: setiap langkah URL beserta kode status (301, 302, 307, 308), tujuan, dan waktunya. Menemukan rantai, loop, dan masalah HTTPS.
- HTTP header checker dengan nilai keamananLihat semua HTTP header dari sebuah URL dan nilai security header-nya: HSTS, Content-Security-Policy, X-Frame-Options, Referrer-Policy – nilai A sampai F.
- Kode status HTTPKode status HTTP dijelaskan: arti 200, 301, 404, 500 dan lebih dari 40 kode lain, dengan pencarian berdasarkan kode atau kata kunci serta filter menurut kelas.
- Cek dan hitung check digit dengan algoritma LuhnValidasi nomor dengan algoritma Luhn (mod 10, ISO/IEC 7812-1) atau hitung check digit-nya – hanya cek format, berjalan sepenuhnya di browser Anda.