Blog

Robots Exclusion Protocol Spesifikasyonunu Resmileştirmek

1 Temmuz 2019 Pazartesi

25 yıldır Robots Exclusion Protocol (REP), web’in en temel ve kritik bileşenlerinden biri olmuştur. Bu protokol, web sitesi sahiplerinin otomatik istemcileri, örneğin
web tarayıcılarını, sitelerine erişmekten kısmen veya tamamen dışlamalarına olanak tanır.

1994 yılında, Martijn Koster
(kendisi de bir web yöneticisi olan), tarayıcılar sitesini bunalttıktan sonra ilk standardı oluşturdu. Diğer web yöneticilerinden gelen ek girdilerle REP doğdu ve web sitesi sahiplerinin sunucu kaynaklarını daha kolay yönetmelerine yardımcı olmak için arama motorları tarafından benimsendi.

Ancak, REP hiçbir zaman resmi bir
İnternet standardıhaline getirilmedi; bu da geliştiricilerin protokolü yıllar içinde biraz farklı yorumladığı anlamına geliyor. Ve ortaya çıkışından bu yana, REP günümüzün uç durumlarını kapsayacak şekilde güncellenmedi. Bu, web sitesi sahipleri için zorlu bir sorun çünkü belirsiz fiili standart, kuralları doğru bir şekilde yazmayı zorlaştırıyordu.

Web sitesi sahiplerinin ve geliştiricilerin, tarayıcıları nasıl kontrol edecekleri konusunda endişelenmek yerine internette harika deneyimler yaratmalarına yardımcı olmak istedik. Protokolün orijinal yazarı, web yöneticileri ve diğer arama motorlarıyla birlikte, REP’in modern web’de nasıl kullanıldığını belgeledik ve IETF’ye sunduk.

Önerilen REP taslağı, hem Googlebot hem de diğer büyük tarayıcıların yanı sıra REP’e güvenen yaklaşık yarım milyar web sitesi tarafından kullanılan robots.txt kurallarına güvenmenin 20 yılı aşkın gerçek dünya deneyimini yansıtmaktadır. Bu hassas kontroller, yayıncıya sitelerinde nelerin taranmasını ve potansiyel olarak ilgili kullanıcılara gösterilmesini istediklerine karar verme gücü verir. 1994 yılında oluşturulan kuralları değiştirmez, aksine robots.txt ayrıştırma ve eşleştirme için tanımlanmamış tüm senaryoları esasen tanımlar ve modern web için genişletir. Özellikle:

  1. Herhangi bir
    URI tabanlı aktarım protokolü
    robots.txt kullanabilir. Örneğin, artık sadece HTTP ile sınırlı değildir ve FTP veya
    CoAP
    için de kullanılabilir.
  2. Geliştiriciler bir robots.txt dosyasının en az ilk 500
    kibibyte kısmını ayrıştırmalıdır. Maksimum dosya boyutunun tanımlanması, bağlantıların çok uzun süre açık kalmamasını sağlayarak sunucular üzerindeki gereksiz yükü hafifletir.
  3. 24 saatlik yeni bir maksimum önbelleğe alma süresi veya mevcutsa önbellek yönergesi değeri, web sitesi sahiplerine robots.txt dosyalarını istedikleri zaman güncelleme esnekliği sağlar ve tarayıcılar web sitelerini robots.txt istekleriyle aşırı yüklemez. Örneğin, HTTP durumunda, önbelleğe alma süresini belirlemek için Cache-Control başlıkları kullanılabilir.
  4. Spesifikasyon artık, daha önce erişilebilir olan bir robots.txt dosyasının sunucu hataları nedeniyle erişilemez hale gelmesi durumunda, bilinen izin verilmeyen sayfaların makul derecede uzun bir süre taranmamasını şart koşmaktadır.

Ek olarak,
artırılmış Backus-Naur formu
internet taslağında, geliştiricilerin satırları ayrıştırması için kritik olan robots.txt sözdizimini daha iyi tanımlamak üzere güncellenmiştir.

RFC, Yorum İsteği (Request for Comments) anlamına gelir ve bunu ciddiye alıyoruz: internetin temel yapı taşlarını önemseyen geliştiricilerden geri bildirim almak için taslağı IETF’ye yükledik. Web yaratıcılarına, Googlebot’a ne kadar bilginin sunulmasını istediklerini ve dolayısıyla Arama’da görünmeye uygun olup olmadığını söylemeleri için ihtiyaç duydukları kontrolleri verme konusunda çalışırken, bunu doğru yaptığımızdan emin olmalıyız.

Bize yorum bırakmak, soru sormak veya sadece merhaba demek isterseniz, bizi
Twitter üzerinde ve
Web Yöneticisi Topluluğumuzda, çevrimdışı ve çevrimiçi bulabilirsiniz.

Alien Road

Biz bunu nasıl uyguluyoruz

Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.

İlgili hizmetler

Paylaş

© Copyright 2026 Alien Road. All rights reserved.