Kısa tanım

robots.txt, bir sitenin kök dizininde duran ve arama motoru ile yapay zeka tarayıcılarına sitenin hangi bölümlerini tarayıp hangilerini taramamaları gerektiğini bildiren, Robots Exclusion Protocol'e dayalı düz metin dosyasıdır.

robots.txt 1994’ten beri kullanılıyor ve 2022’de RFC 9309 ile standart haline geldi. Dosya alanadi.com/robots.txt adresinde durur. Her kural, bir botun adını (User-agent) ve o botun girebileceği ya da giremeyeceği yolları (Allow, Disallow) içerir.

Yapay zeka botları ve robots.txt

OpenAI, Anthropic, Perplexity ve Google gibi şirketler, yapay zeka botlarının adlarını ve robots.txt kurallarına uyduklarını belgelerinde açıklıyor. Bu sayede site sahibi örneğin model eğitimi için veri toplayan botu engellerken, arama yapıp kaynak gösteren botu açık bırakabilir.

Dikkat edilmesi gereken iki nokta var:

  • robots.txt bir rica dosyasıdır, bir güvenlik önlemi değildir. Kurallara uymayan bir bot dosyayı yok sayabilir.
  • Hazır güvenlik ve CDN ayarları bazen yapay zeka botlarını site sahibinin haberi olmadan engeller. Sitenin yapay zeka cevaplarında hiç geçmemesinin sebebi bazen budur.

Örnek

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Bu kurallar OpenAI’ın eğitim verisi toplayan botunu engeller, ChatGPT aramasında kullanılan botu ise serbest bırakır. Hangi botun ne yaptığı yapay zeka botları ve llms.txt rehberinde anlatılıyor.

Sitenizin yapay zeka görünürlüğünü ücretsiz ölçelim