2 Temmuz 2019, Salı
Dün, Google’ın üretim robots.txt ayrıştırıcısını
açık kaynaklı hale getirdiğimizi duyurduk.
Gelecekteki potansiyel Arama açık kaynak projelerinin önünü açan heyecan verici bir andı! Geri bildirimler faydalıdır ve
geliştiricilerden ve
web yöneticilerinden gelen soruları hevesle topluyoruz. Bu yazıda ele alacağımız bir soru öne çıktı:
Neden crawl-delay gibi diğer kurallar için bir kod işleyici koda dahil edilmedi?
Dün yayınladığımız internet taslağı, standart kapsamında olmayan kurallar için genişletilebilir bir mimari sunuyor. Bu, bir tarayıcının kendi satırını desteklemek istemesi durumunda unicorns: allowed, bunu yapabileceği anlamına gelir. Bunun bir ayrıştırıcıda nasıl görüneceğini göstermek için, çok yaygın bir satır olan sitemap’i açık kaynaklı robots.txt ayrıştırıcımıza.
dahil ettik. Ayrıştırıcı kütüphanemizi açık kaynaklı hale getirirken, robots.txt kurallarının kullanımını analiz ettik. Özellikle, internet taslağı tarafından desteklenmeyen kurallara odaklandık, örneğin
crawl-delay, nofollow, ve
noindex. Bu kurallar Google tarafından hiçbir zaman belgelenmediğinden, Googlebot ile ilişkili kullanımları doğal olarak çok düşüktür. Daha derinlemesine incelediğimizde, kullanımlarının internetteki tüm robots.txt dosyalarının %0,001’i hariç hepsinde diğer kurallarla çeliştiğini gördük. Bu hatalar, web sitelerinin Google arama sonuçlarındaki varlığına web yöneticilerinin amaçlamadığını düşündüğümüz şekillerde zarar veriyor.
Sağlıklı bir ekosistemi korumak ve gelecekteki potansiyel açık kaynak sürümlerine hazırlanmak adına, desteklenmeyen ve yayınlanmamış kuralları (örneğin
noindex) işleyen tüm kodları 1 Eylül 2019 itibarıyla kullanımdan kaldırıyoruz. Tarama işlemini kontrol eden
noindex dizin oluşturma kuralına
robots.txt dosyasında güvenenleriniz için bir dizi alternatif seçenek mevcuttur:
noindex
içinde robotsmetaetiketleri: Hem HTTP yanıt başlıklarında hem de HTML’de desteklenen
noindexkuralı, taramaya izin verildiğinde URL’leri dizinden kaldırmanın en etkili yoludur.404ve410HTTP durum kodları:
Her iki durum kodu da sayfanın mevcut olmadığı anlamına gelir; bu, söz konusu URL’ler tarandığında ve işlendiğinde Google’ın dizininden düşmelerini sağlayacaktır.- Şifre koruması: İşaretleme
abonelik veya ödeme duvarı arkasındaki içerikbelirtmek için kullanılmadığı sürece, bir sayfayı girişin arkasına gizlemek genellikle onu Google’ın dizininden kaldıracaktır. Disallowiçinderobots.txt: Arama motorları yalnızca bildikleri sayfaları dizine ekleyebilir, bu nedenle bir sayfanın taranmasını engellemek genellikle içeriğinin dizine eklenmeyeceği anlamına gelir. Arama motoru bir URL’yi diğer sayfalardan gelen bağlantılara dayanarak dizine ekleyebilse de, içeriğin kendisini görmeden, gelecekte bu tür sayfaları daha az görünür kılmayı hedefliyoruz.- Search Console URL Kaldırma aracı:
Bu araç, bir URL’yi Google arama sonuçlarından geçici olarak kaldırmak için hızlı ve kolay bir yöntemdir.
Google arama sonuçlarından bilgilerin nasıl kaldırılacağı hakkında daha fazla rehberlik için
Yardım Merkezimiziziyaret edin. Sorularınız varsa, bizi Twitter
üzerinden ve Web Yöneticisi Topluluğumuzda, hem çevrimdışı hem de çevrimiçi bulabilirsiniz.
Biz bunu nasıl uyguluyoruz
Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.
İlgili hizmetler