robots.txt kontrol ve site haritası testi

Bu robots.txt kontrol aracı, girdiğiniz URL için Googlebot, Bingbot ve GPTBot, ClaudeBot gibi yapay zekâ tarayıcılarının sayfayı getirip getiremeyeceğini ve kararı hangi kuralın verdiğini gösterir. Ayrıca söz dizimi hatalarını bulur ve site haritasını kontrol eder: URL sayısı, başka alan adları ve lastmod biçimi.

Kaynak: RFC 9309 – Robots Exclusion Protocol. Güncelleme: .

Araçlarım

Tıkladığınızda tarayıcınız girdiğiniz URL’yi sunucumuza (Cloudflare Worker) gönderir. Sunucu sayfayı “ToolboxDayBot” olarak getirir, sitenin robots.txt dosyasına uyar ve yalnızca analizi geri gönderir. URL ve IP adresi kaydedilmez; saatte 30 kontrol sınırı için sunucu, IP’nizin geri döndürülemez bir özetini (hash) en fazla bir saat boyunca yalnızca bellekte tutar.

Sonuç

Sonuç
–
Taranabilir mi?
Kontroller
Öneriler
robots.txt kuralları
Site haritasından örnekler

Nasıl hesaplanır?

Tarayıcılar robots.txt dosyasını nasıl okur?

Dosya her zaman alan adının kök dizinindedir (https://example.com/robots.txt) ve yalnızca o alan adı ile protokol için geçerlidir. Biçimi 2022’den beri RFC 9309 ile standarttır:

Google yalnızca user-agent, allow, disallow ve sitemap satırlarını okur, en fazla 500 KiB. Crawl-delay ve Noindex satırlarını yok sayar – araç bunu belirtir.

Taramayı engellemek dizine eklemeyi engellemez

Engellenmiş bir URL, başka sayfalar ona bağlantı veriyorsa sonuçlarda açıklamasız görünebilir. Bir sayfayı dizinden kesin olarak çıkarmak için noindex (meta etiketi veya X-Robots-Tag) kullanın ve sayfanın taranmasına izin verin; aksi hâlde Google noindex’i hiç göremez.

Yapay zekâ botları ve site haritası

Araç GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google’ın yapay zekâ modellerinde kullanım) ve CCBot’u (Common Crawl) da test eder: birini engellemek için User-agent: GPTBot ve Disallow: / içeren bir grup yeterlidir. Ardından robots.txt’deki ilk site haritasını, yoksa /sitemap.xml adresini kontrol eder: en fazla 50.000 URL ve 50 MB, tek alan adı ve W3C biçiminde lastmod. Yeni bir site haritası için sitemap oluşturucuyu kullanabilirsiniz. Sıkıştırılmış site haritaları (.xml.gz) açılmaz, büyük dosyalar 2 MB’a kadar okunur.

Sıkça sorulan sorular

robots.txt nedir?

Sitenin kök dizinindeki, arama motoru tarayıcılarına hangi bölümleri gezebileceklerini söyleyen bir metin dosyasıdır. Hiçbir şeyi korumaz: kötü niyetli botlar onu yok sayar ve bir şifrenin yerini tutmaz.

robots.txt dosyamı nasıl test ederim?

Sitenizden bir sayfanın adresini girip “robots.txt kontrol et”e tıklayın. Tablo; Googlebot, Bingbot, yapay zekâ botları ve diğer tüm tarayıcılar için tam o URL’nin izinli olup olmadığını ve kararı veren kuralı gösterir. Google’ın kendi robots.txt raporu Search Console’dadır.

“Disallow: /” ne anlama gelir?

Eğik çizgi tüm yolları temsil eder: o gruptaki tarayıcılar hiçbir şey getiremez. User-agent: * altında tüm siteyi herkese kapatır – yalnızca test ortamlarında mantıklıdır.

Site haritası robots.txt’ye yazılmalı mı?

İsteğe bağlıdır ama kullanışlıdır: Sitemap: https://example.com/sitemap.xml gibi bir satır tüm arama motorlarının haritayı bulmasına yardım eder. URL, https:// ve alan adıyla tam olmalıdır.

Engellediğim sayfa neden yine de Google’da çıkıyor?

robots.txt yalnızca sayfanın getirilmesini engeller. Başka sayfalar URL’ye bağlantı veriyorsa Google onu açıklamasız listeleyebilir. Dizinden çıkarmak için noindex kullanın ve taramaya izin verin.

Kaynaklar ve yasal dayanak

Güncelleme:

Benzer araçlar