robots.txt · llms.txt

Yapay zeka botları, robots.txt ve llms.txt: hangi kapıyı açık tutmalı?

Yapay zeka şirketlerinin botları farklı işler yapıyor: kimi model eğitimi için veri topluyor, kimi canlı aramada sayfanızı okuyor. Hangisine izin vereceğinizi bilerek seçmeniz gerekiyor.

Bir sitenin yapay zeka cevaplarında görünmemesinin en sıradan sebebi, botların siteye hiç giremiyor olması. Bunu analiz yaptığımız sitelerde sık görüyoruz: biri yıllar önce robots.txt dosyasına geniş bir yasak yazmış, ya da CDN’in güvenlik ayarı yeni bir botu saldırgan sanıp kapıdan çevirmiş. Site sahibi çoğu zaman bundan habersiz.

Bu yazıda büyük yapay zeka şirketlerinin botlarını, aralarındaki farkı ve robots.txt ile nasıl yönetileceğini anlatıyoruz. Sonda da son zamanlarda çok konuşulan llms.txt dosyasına bakıyoruz.

Botlar tek tip değil

Yapay zeka şirketlerinin botlarını üç gruba ayırmak işinizi kolaylaştırır:

  1. Eğitim botları. Gelecekteki modelleri eğitmek için içerik toplar. Bunları engellemek, içeriğinizin bundan sonraki model eğitimlerinde kullanılmamasını sağlar.
  2. Arama botları. Yapay zeka aracının kendi arama dizinini kurar. Bunları engellerseniz siteniz o aracın arama cevaplarında kaynak olarak gösterilmeyebilir.
  3. Kullanıcı adına gelen botlar. Bir kullanıcı soru sorduğunda ya da bir bağlantıyı açmasını istediğinde o anda sayfayı çeker.

Bu ayrım önemli, çünkü “yapay zekaya içeriğimi vermek istemiyorum” ile “yapay zeka cevaplarında görünmek istiyorum” aynı anda mümkün. Eğitim botunu kapatıp arama botunu açık tutabilirsiniz.

Kim kimdir?

Şirket Bot Ne yapar robots.txt
OpenAI GPTBot Model eğitimi için içerik toplar Uyar
OpenAI OAI-SearchBot ChatGPT aramasında siteleri gösterir Uyar
OpenAI ChatGPT-User Kullanıcının ChatGPT içindeki işlemleri için sayfa çeker Kullanıcı başlattığı için kurallar uygulanmayabilir
Anthropic ClaudeBot Model geliştirme için içerik toplar Uyar
Anthropic Claude-SearchBot Claude’un arama sonuçlarının kalitesi için tarar Uyar
Anthropic Claude-User Kullanıcı sorusu için sayfa çeker Uyar
Perplexity PerplexityBot Perplexity arama sonuçları için dizin kurar Uyar
Perplexity Perplexity-User Kullanıcı sorusu için sayfa çeker Genellikle uymaz
Google Google-Extended Ayrı bir bot değil, kontrol anahtarı. Gemini eğitimi ve Gemini uygulamalarında kullanım için izin verir ya da vermez Uyar

Bu tablo şirketlerin kendi belgelerine dayanıyor. Botların adları ve davranışları zaman zaman değişiyor, eski bir listeye göre yazılmış kurallar işe yaramayabiliyor. Yazının sonunda verdiğimiz kaynaklardan güncel durumu kontrol etmenizi öneririz.

Google-Extended neden farklı?

Google-Extended’in ayrı bir bot olmadığını özellikle belirtelim. Google, tarama işini mevcut botlarıyla yapıyor. Google-Extended yalnız robots.txt içinde kullanılan bir anahtar. Google’ın belgesine göre bu anahtar sitenizin Google Arama’da yer alıp almamasını etkilemiyor ve sıralama sinyali olarak da kullanılmıyor.

Bir de şuna dikkat: Google’ın yapay zeka özetleri (AI Overviews) ve AI Mode, Google Arama’nın parçası. Google, bu özelliklerde sayfanızdan ne gösterileceğini sınırlamak için Google-Extended’i değil, nosnippet, max-snippet ya da noindex gibi Arama kontrollerini gösteriyor. Google-Extended ise Google’ın diğer sistemlerindeki eğitim ve kullanım için. Buralarda görünmek için sayfanın Google dizininde olması gerekiyor.

Örnek robots.txt

Aşağıdaki örnek, sık gördüğümüz bir tercihi yansıtıyor: içerik model eğitimine verilmiyor, ama yapay zeka aramalarında görünmeye açık.

# Model eğitimi için toplayan botlar: kapalı
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Yapay zeka aramaları ve kullanıcı istekleri: açık
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

# Diğer tüm botlar
User-agent: *
Disallow: /yonetim/

Sitemap: https://www.ornekfirma.com.tr/sitemap.xml

Bu bir şablon değil, örnek. Kimi işletme içeriğinin eğitimde kullanılmasında bir sakınca görmüyor ve her şeyi açık tutuyor. Kimi de tam tersini istiyor. İki tercih de meşru. Önemli olan, kararın bilinçli verilmesi.

İki hatırlatma:

  • robots.txt bir rica, kilit değil. Google da bunu kendi belgesinde açıkça yazıyor: tüm botlar bu kurallara uymayabilir. Gizli kalması gereken bir sayfa varsa şifreyle korumak gerekir.
  • Yukarıdaki tabloda gördüğünüz gibi, kullanıcı adına gelen botların bir kısmı robots.txt kurallarını uygulamayabiliyor. Bunlar bir kullanıcının o anki isteğiyle geldiği için şirketler onları sıradan bir tarayıcı gibi değerlendirmiyor.

Görünmeyen engel: CDN ve güvenlik duvarı

robots.txt dosyanız tertemiz olsa da botlar sitenize giremeyebilir. Cloudflare gibi CDN’ler ve güvenlik duvarları (WAF), yapay zeka botlarını yönetmek için ayrı ayarlar sunuyor. Cloudflare’in AI Crawl Control aracı, hangi yapay zeka botunun sitenize geldiğini gösteriyor ve her bot için ayrı ayrı izin verme ya da engelleme kuralı yazmanıza imkan veriyor. Bu ayarlar bazen bir panel güncellemesiyle ya da bir ekip arkadaşının tek tıkla açtığı bir seçenekle devreye giriyor.

Sonuç: robots.txt “açık” diyor, ama bot kapıda 403 hatası alıp geri dönüyor. Biz analizlerde bunu ayrıca kontrol ediyoruz. Siz de şunlara bakabilirsiniz:

  • CDN panelindeki bot ve yapay zeka ayarları
  • Güvenlik duvarı kurallarında kullanıcı aracısına (user agent) göre engelleme
  • Sunucu kayıtlarında (log) yapay zeka botlarının aldığı cevap kodları. 200 iyi, 403 ya da 503 sorun.

llms.txt nedir, ne değildir?

llms.txt, sitenin kök dizinine konan, Markdown biçiminde yazılmış bir dosya önerisi. Jeremy Howard tarafından Eylül 2024’te ortaya atıldı. Fikir basit: büyük dil modellerine sitenin ne olduğunu kısaca anlatmak ve en önemli sayfaların listesini temiz bir biçimde sunmak. Dosyada bir başlık, kısa bir özet ve açıklamalı bağlantı listeleri bulunuyor.

Bunu bilerek kullanmak için bilmeniz gerekenler:

  • Bir standart değil, bir öneri. llmstxt.org sayfası da kendini öneri olarak tanımlıyor. Bir standart kuruluşunun onayladığı bir belge değil.
  • Büyük şirketlerin desteği belirsiz. Google, yapay zeka özellikleri belgesinde bu özellikler için yeni makine okunur dosyalar, “yapay zeka metin dosyaları” ya da özel işaretleme gerekmediğini açıkça yazıyor.
  • robots.txt’nin yerini tutmaz. llms.txt bir izin dosyası değil. Hangi botun gireceğini robots.txt belirler.

Peki koymalı mı? Bizim tutumumuz şöyle: hazırlaması kolay, zararı yok, ama mucize de beklemeyin. Özellikle dokümantasyonu olan yazılım şirketleri için kullanışlı olabiliyor, çünkü yapay zeka destekli kod araçları bu tür dosyaları okuyabiliyor. Sıradan bir işletme sitesinde öncelik listesinin sonlarında duruyor. Önce kapıların açık olduğundan, sitenin hızlı ve okunur olduğundan emin olun.

Nereden başlamalı?

  1. Sitenizin robots.txt dosyasını açın (siteniz.com/robots.txt) ve yapay zeka botlarına ne dendiğine bakın.
  2. Eğitim botları ve arama botları için ayrı bir karar verin, bunu dosyaya yazın.
  3. CDN ve güvenlik duvarı ayarlarında yapay zeka botlarına dair kuralları kontrol edin.
  4. Sunucu kayıtlarında bu botların gerçekten 200 cevabı aldığını doğrulayın.
  5. llms.txt isterseniz ekleyin, ama ilk dört adımdan sonra.

Terimlerin kısa tanımları için yapay zeka botları, robots.txt ve llms.txt sözlük maddelerine bakabilirsiniz. Sitenizin botlara açık olup olmadığını kontrol etmemizi isterseniz ücretsiz analiz formunu doldurabilirsiniz.

Kaynaklar

  1. OpenAI: Overview of OpenAI crawlers developers.openai.com
  2. Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler? support.claude.com
  3. Perplexity: Perplexity Crawlers docs.perplexity.ai
  4. Google Search Central: Google's common crawlers (Google-Extended) developers.google.com
  5. llms.txt önerisi (llmstxt.org) llmstxt.org
  6. Cloudflare: AI Crawl Control developers.cloudflare.com
Ücretsiz analiz

Sektörünüzde yapay zeka kimi öneriyor, birlikte bakalım.

Site adresinizi ve sektörünüzü bırakın. İlk analizi ücretsiz yapıp sonucu size gönderelim.

Doğrudan yazmak isterseniz: bilgi@sparkzone.tech

Bilgilerinizi yalnızca bu analiz için kullanırız.