robots.txt kontrol ve site haritası testi
Bu robots.txt kontrol aracı, girdiğiniz URL için Googlebot, Bingbot ve GPTBot, ClaudeBot gibi yapay zekâ tarayıcılarının sayfayı getirip getiremeyeceğini ve kararı hangi kuralın verdiğini gösterir. Ayrıca söz dizimi hatalarını bulur ve site haritasını kontrol eder: URL sayısı, başka alan adları ve lastmod biçimi.
Kaynak: RFC 9309 – Robots Exclusion Protocol. Güncelleme: .
Nasıl hesaplanır?
Tarayıcılar robots.txt dosyasını nasıl okur?
Dosya her zaman alan adının kök dizinindedir (https://example.com/robots.txt) ve yalnızca o alan adı ile protokol için geçerlidir. Biçimi 2022’den beri RFC 9309 ile standarttır:
- Gruplar: bir veya birkaç
User-agentsatırı ve altındaAllowileDisallowkuralları. Bir tarayıcı yalnızca kendi adını taşıyan gruba uyar; yoksaUser-agent: *grubu geçerlidir. - En uzun kural kazanır:
Disallow: /magazaveAllow: /magaza/firsatlarvarsa /magaza/firsatlar/1 izinlidir. Eşitlikte Allow kazanır. - Joker karakterler:
*herhangi karakterleri,$URL’nin sonunu belirtir:Disallow: /*.pdf$tüm PDF’leri engeller. - Dosya yoksa (404) her şey taranabilir. 5xx hatasında Google taramayı duraklatır.
Google yalnızca user-agent, allow, disallow ve sitemap satırlarını okur, en fazla 500 KiB. Crawl-delay ve Noindex satırlarını yok sayar – araç bunu belirtir.
Taramayı engellemek dizine eklemeyi engellemez
Engellenmiş bir URL, başka sayfalar ona bağlantı veriyorsa sonuçlarda açıklamasız görünebilir. Bir sayfayı dizinden kesin olarak çıkarmak için noindex (meta etiketi veya X-Robots-Tag) kullanın ve sayfanın taranmasına izin verin; aksi hâlde Google noindex’i hiç göremez.
Yapay zekâ botları ve site haritası
Araç GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google’ın yapay zekâ modellerinde kullanım) ve CCBot’u (Common Crawl) da test eder: birini engellemek için User-agent: GPTBot ve Disallow: / içeren bir grup yeterlidir. Ardından robots.txt’deki ilk site haritasını, yoksa /sitemap.xml adresini kontrol eder: en fazla 50.000 URL ve 50 MB, tek alan adı ve W3C biçiminde lastmod. Yeni bir site haritası için sitemap oluşturucuyu kullanabilirsiniz. Sıkıştırılmış site haritaları (.xml.gz) açılmaz, büyük dosyalar 2 MB’a kadar okunur.
Sıkça sorulan sorular
robots.txt nedir?
Sitenin kök dizinindeki, arama motoru tarayıcılarına hangi bölümleri gezebileceklerini söyleyen bir metin dosyasıdır. Hiçbir şeyi korumaz: kötü niyetli botlar onu yok sayar ve bir şifrenin yerini tutmaz.
robots.txt dosyamı nasıl test ederim?
Sitenizden bir sayfanın adresini girip “robots.txt kontrol et”e tıklayın. Tablo; Googlebot, Bingbot, yapay zekâ botları ve diğer tüm tarayıcılar için tam o URL’nin izinli olup olmadığını ve kararı veren kuralı gösterir. Google’ın kendi robots.txt raporu Search Console’dadır.
“Disallow: /” ne anlama gelir?
Eğik çizgi tüm yolları temsil eder: o gruptaki tarayıcılar hiçbir şey getiremez. User-agent: * altında tüm siteyi herkese kapatır – yalnızca test ortamlarında mantıklıdır.
Site haritası robots.txt’ye yazılmalı mı?
İsteğe bağlıdır ama kullanışlıdır: Sitemap: https://example.com/sitemap.xml gibi bir satır tüm arama motorlarının haritayı bulmasına yardım eder. URL, https:// ve alan adıyla tam olmalıdır.
Engellediğim sayfa neden yine de Google’da çıkıyor?
robots.txt yalnızca sayfanın getirilmesini engeller. Başka sayfalar URL’ye bağlantı veriyorsa Google onu açıklamasız listeleyebilir. Dizinden çıkarmak için noindex kullanın ve taramaya izin verin.
Kaynaklar ve yasal dayanak
- RFC 9309 – Robots Exclusion Protocol
- Google Search Central – How Google interprets the robots.txt specification (500 KiB, supported fields, 5xx handling)
- sitemaps.org – Sitemaps XML format (50,000 URLs, 50 MB, single host, W3C Datetime)
- W3C – Date and Time Formats (W3C Datetime)
- OpenAI – Overview of OpenAI crawlers (GPTBot)
- Google – Overview of Google common crawlers (Google-Extended)
Güncelleme:
Benzer araçlar
- Sitemap oluşturucu: URL listenizden sitemap.xml hazırlayınSitemap oluşturucu, kayıt gerektirmez: URL’leri yapıştırın, Sitemaps protokolüne uygun sitemap.xml alın, hataları kontrol edin ve indirin. Tarayıcıda çalışır.
- Ücretsiz SEO analizi: web sayfanızı test edinHer URL için ücretsiz SEO analizi: title, meta description, H1, canonical, hreflang, noindex, Open Graph, yapılandırılmış veri ve alt – puan ve önerilerle.
- Yönlendirme kontrol aracı: URL zincirini görünOnline yönlendirme kontrol: bir URL’nin her adımını durum kodu (301, 302, 307, 308), hedef ve süreyle gösterir; zincir, döngü ve HTTPS hatalarını bulur.
- HTTP header kontrol ve güvenlik notuBir URL’nin tüm HTTP header’larını görün ve güvenlik başlıklarını puanlayın: HSTS, Content-Security-Policy, X-Frame-Options, Referrer-Policy – A’dan F’ye not.
- HTTP durum kodlarıHTTP durum kodları açıklandı: 200, 301, 404, 500 ve 40’tan fazla kodun anlamı; koda veya anahtar kelimeye göre arama ve sınıfa göre filtre ile.
- AB KDV numarası doğrulama (format ve kontrol hanesi)AB KDV numarası doğrulama: 27 AB ülkesi ve Kuzey İrlanda (XI) için KDV kimlik numarasının formatını ve kontrol hanesini kontrol edin. VIES bağlantısıyla.