Blog

robots.txt dosyasındaki desteklenmeyen kurallar hakkında bir not

2 Temmuz 2019, Salı

Dün, Google’ın üretim robots.txt ayrıştırıcısını
açık kaynaklı hale getirdiğimizi duyurduk.
Gelecekteki potansiyel Arama açık kaynak projelerinin önünü açan heyecan verici bir andı! Geri bildirimler faydalıdır ve
geliştiricilerden ve
web yöneticilerinden gelen soruları hevesle topluyoruz. Bu yazıda ele alacağımız bir soru öne çıktı:

Neden crawl-delay gibi diğer kurallar için bir kod işleyici koda dahil edilmedi?

Dün yayınladığımız internet taslağı, standart kapsamında olmayan kurallar için genişletilebilir bir mimari sunuyor. Bu, bir tarayıcının kendi satırını desteklemek istemesi durumunda unicorns: allowed, bunu yapabileceği anlamına gelir. Bunun bir ayrıştırıcıda nasıl görüneceğini göstermek için, çok yaygın bir satır olan sitemap’i açık kaynaklı robots.txt ayrıştırıcımıza.

dahil ettik. Ayrıştırıcı kütüphanemizi açık kaynaklı hale getirirken, robots.txt kurallarının kullanımını analiz ettik. Özellikle, internet taslağı tarafından desteklenmeyen kurallara odaklandık, örneğin
crawl-delay, nofollow, ve
noindex. Bu kurallar Google tarafından hiçbir zaman belgelenmediğinden, Googlebot ile ilişkili kullanımları doğal olarak çok düşüktür. Daha derinlemesine incelediğimizde, kullanımlarının internetteki tüm robots.txt dosyalarının %0,001’i hariç hepsinde diğer kurallarla çeliştiğini gördük. Bu hatalar, web sitelerinin Google arama sonuçlarındaki varlığına web yöneticilerinin amaçlamadığını düşündüğümüz şekillerde zarar veriyor.

Sağlıklı bir ekosistemi korumak ve gelecekteki potansiyel açık kaynak sürümlerine hazırlanmak adına, desteklenmeyen ve yayınlanmamış kuralları (örneğin
noindex) işleyen tüm kodları 1 Eylül 2019 itibarıyla kullanımdan kaldırıyoruz. Tarama işlemini kontrol eden
noindex dizin oluşturma kuralına
robots.txt dosyasında güvenenleriniz için bir dizi alternatif seçenek mevcuttur:

  • noindex
    içinde robots meta etiketleri:
    Hem HTTP yanıt başlıklarında hem de HTML’de desteklenen
    noindex kuralı, taramaya izin verildiğinde URL’leri dizinden kaldırmanın en etkili yoludur.
  • 404 ve 410 HTTP durum kodları:
    Her iki durum kodu da sayfanın mevcut olmadığı anlamına gelir; bu, söz konusu URL’ler tarandığında ve işlendiğinde Google’ın dizininden düşmelerini sağlayacaktır.
  • Şifre koruması: İşaretleme
    abonelik veya ödeme duvarı arkasındaki içerikbelirtmek için kullanılmadığı sürece, bir sayfayı girişin arkasına gizlemek genellikle onu Google’ın dizininden kaldıracaktır.
  • Disallow içinde robots.txt: Arama motorları yalnızca bildikleri sayfaları dizine ekleyebilir, bu nedenle bir sayfanın taranmasını engellemek genellikle içeriğinin dizine eklenmeyeceği anlamına gelir. Arama motoru bir URL’yi diğer sayfalardan gelen bağlantılara dayanarak dizine ekleyebilse de, içeriğin kendisini görmeden, gelecekte bu tür sayfaları daha az görünür kılmayı hedefliyoruz.
  • Search Console URL Kaldırma aracı:
    Bu araç, bir URL’yi Google arama sonuçlarından geçici olarak kaldırmak için hızlı ve kolay bir yöntemdir.

Google arama sonuçlarından bilgilerin nasıl kaldırılacağı hakkında daha fazla rehberlik için
Yardım Merkezimiziziyaret edin. Sorularınız varsa, bizi Twitter
üzerinden ve Web Yöneticisi Topluluğumuzda, hem çevrimdışı hem de çevrimiçi bulabilirsiniz.

Alien Road

Biz bunu nasıl uyguluyoruz

Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.

İlgili hizmetler

Paylaş

© Copyright 2026 Alien Road. All rights reserved.