Blog

Googlebot ile ilk buluşma: Başlıklar ve sıkıştırma

6 Mart 2008, Perşembe

googlebot with flowers

İsim/User-Agent: Googlebot
IP Adresi: Googlebot isteklerini nasıl doğrulayacağınızı öğrenin
Aradığı: Benzersiz ve ilgi çekici içeriğe sahip web siteleri
En Sevmediği: Web Yöneticisi Yönergeleri ihlalleri Googlebot —ne harika bir hayal. Sanki bizi <head>, <body> ve ruhumuza kadar tanıyor. Muhtemelen özel bir şey aramıyor; milyarlarca başka site görüyor (gerçi verilerimizi diğer botlarla da paylaşıyoruz), ama bu gece web sitesi ve tarayıcı olarak birbirimizi gerçekten tanıyacağız.

Biliyorum, ilk buluşmayı fazla analiz etmek asla iyi değildir. Googlebot’u bir dizi yazı ile biraz daha yavaş tanıyacağız:

  1. İlk buluşmamız (bu gece!): Googlebot’un gönderdiği başlıklar, “fark ettiği” dosya formatları, verileri sıkıştırmanın daha iyi olup olmadığı
  2. Yanıtlarını değerlendirme: Yanıt kodları (301, 302), yönlendirmeleri ve If-Modified-Since komutunu nasıl ele aldığı
  3. Sonraki adımlar: Bağlantıları takip etme, tarama hızını artırma veya azaltma (böylece çok baskın gelmezler)

Ve bu gece sadece ilk buluşma…


Googlebot: ACK

Web Sitesi: Googlebot, buradasın!

Googlebot: Buradayım.

Web Sitesi: O başlıklar çok gösterişli! Sitem ABD, Asya veya Avrupa’da olsaydı aynı başlıklarla mı tarama yapardın? Hiç farklı başlıklar kullandığın olur mu?

Googlebot: Başlıklarım dünya genelinde genellikle tutarlıdır. Sitenin varsayılan dili ve ayarları için bir sayfanın nasıl göründüğünü anlamaya çalışıyorum. Bazen User-Agent farklı olabilir; örneğin AdSense getirmeleri Mediapartners-Google kullanır:

Veya görsel arama için:

Kablosuz getirmeler genellikle operatöre özel kullanıcı aracıları kullanırken, Google Reader RSS getirmeleri abone sayısı gibi ek bilgiler içerir.

Genellikle çerezlerden kaçınırım (bu yüzden Cookie: başlığı yoktur), çünkü içeriğin oturuma özel bilgilerden çok fazla etkilenmesini istemem. Ayrıca, bir sunucu çerez yerine dinamik bir URL’de oturum kimliği kullanıyorsa, bunu genellikle çözebilirim; böylece aynı sayfanızı milyonlarca farklı oturum kimliğiyle milyonlarca kez taramamış olurum.

Web Sitesi: Çok karmaşığım. Birçok dosya türüm var. Başlıkların Accept: */* diyor. Tüm URL’leri dizine ekliyor musun yoksa belirli dosya uzantıları otomatik olarak filtreleniyor mu?

Googlebot: Bu ne aradığıma bağlı. Normal web araması için dizine ekleme yapıyorsam ve MP3 veya video bağlantıları görürsem, muhtemelen bunları indirmem. Benzer şekilde, bir JPG görürsem, ona bir HTML veya PDF bağlantısından farklı davranırım. Örneğin, JPG’nin değişme olasılığı HTML’ye göre çok daha düşüktür, bu yüzden bant genişliğinden tasarruf etmek için JPG’deki değişiklikleri daha az sıklıkla kontrol ederim. Bu arada, Google Akademik olarak bağlantı arıyorsam, JPG dosyasından çok PDF makalesiyle ilgilenirim. Karalamalar (JPG gibi) ve kaykay yapan köpek videoları indirmek bir akademisyen için dikkat dağıtıcıdır—katılıyor musun?

Web Sitesi: Evet, dikkat dağıtıcı olabilirler. Adanmışlığına hayranım. Karalamaları (JPG’leri) seviyorum ve onlara karşı koymakta zorlanıyorum.

Googlebot: Ben de; her zaman o kadar akademik değilim. Görsel arama için tarama yaptığımda JPG’lerle çok ilgilenirim. Haberler içinse çoğunlukla HTML’ye ve yakındaki görsellere bakarım.

Ayrıca, büyük olma eğiliminde olan ve bir arama motoru için daha az yararlı olan birçok uzantı (exe, dll, zip, dmg…) vardır.

Web Sitesi: URL’mi, https://www.example.com/page1.LOL111, görseydin, sırf bilinmeyen bir dosya uzantısı içerdiği için onu (hıçkırarak) reddeder miydin?

Googlebot: Web sitesi, biraz daha arka plan bilgisi vereyim. Bir dosyayı gerçekten indirdikten sonra, onun gerçekten HTML, görsel, metin veya başka bir şey olup olmadığını kontrol etmek için Content-Type başlığını kullanırım. PDF dosyası, Word belgesi veya Excel tablosu gibi özel bir veri türüyse, geçerli formatta olduğundan emin olur ve metin içeriğini çıkarırım. Belki virüslüdür; asla bilemezsiniz. Belge veya veri türü gerçekten bozuksa, içeriği atmaktan başka yapacak pek bir şey yoktur.

Yani, bilinmeyen bir dosya uzantısına sahip https://www.example.com/page1.LOL111 adresini tarıyorsam, muhtemelen indirmeye başlarım. İçerik türünü başlıktan anlayamazsam veya dizine eklemediğimiz bir formattaysa (örneğin mp3), o zaman bir kenara bırakılır. Aksi takdirde, dosyayı dizine eklemeye devam ederiz.

Web Sitesi: Tarzını incelediğim için özür dilerim Googlebot, ancak Accept-Encoding başlıklarının şunları söylediğini fark ettim:

Bu başlıkları bana açıklayabilir misin?

Googlebot: Elbette. Tüm büyük arama motorları ve web tarayıcıları, bant genişliğinden tasarruf etmek için içerik için gzip sıkıştırmasını destekler. Burada görebileceğiniz diğer girişler arasında x-gzip (gzip ile aynı), deflate (bunu da destekliyoruz) ve identity (hiçbiri) bulunur.

Web Sitesi: Dosya sıkıştırma ve Accept-Encoding: gzip,deflate hakkında daha fazla konuşabilir misin? URL’lerimin çoğu sadece HTML değil, büyük Flash dosyaları ve çarpıcı görsellerden oluşuyor. Daha büyük dosyalarımı sıkıştırırsam daha hızlı taramama yardımcı olur mu?

Googlebot: Bu sorunun basit bir cevabı yok. Öncelikle, swf (Flash), jpg, png, gif ve pdf gibi birçok dosya formatı zaten sıkıştırılmıştır (ayrıca özel Flash iyileştiricileri de vardır).

Web Sitesi: Belki de Flash dosyalarımı sıkıştırıyordum ve haberim bile yoktu? Açıkçası çok verimliyim.

Googlebot: Hem Apache hem de IIS’nin gzip ve deflate sıkıştırmasını etkinleştirme seçenekleri vardır, ancak tasarruf edilen bant genişliği için bir CPU maliyeti söz konusudur. Genellikle, yalnızca kolayca sıkıştırılabilir metin HTML/CSS/PHP içeriği için etkinleştirilir. Ve sadece kullanıcının tarayıcısı veya ben (bir arama motoru tarayıcısı) izin verirsem kullanılır. Şahsen, deflate yerine gzip tercih ederim. Gzip biraz daha sağlam bir kodlamadır—tutarlı bir şekilde bir sağlama toplamı ve tam bir başlık vardır, bu da bana deflate’e göre daha az tahmin yürütme imkanı verir. Bunun dışında çok benzer sıkıştırma algoritmalarıdır.

Sunucularınızda boş CPU varsa, sıkıştırmayı denemeye değer olabilir (bağlantılar: Apache, IIS). Ancak, dinamik içerik sunuyorsanız ve sunucularınız zaten ağır CPU yükü altındaysa, beklemek isteyebilirsiniz.

Web Sitesi: Harika bilgiler. Bu gece geldiğin için gerçekten çok memnunum—iyi ki robots.txt dosyam buna izin verdi. O dosya aşırı korumacı bir ebeveyn gibi olabilir!

Googlebot: Ah evet; ebeveynlerle tanışmak, robots.txt. Birçoğuyla tanıştım. Bazıları gerçekten geçerli bir robots.txt yerine sadece HTML hata sayfalarıdır. Bazılarında her yerde sonsuz yönlendirmeler vardır, belki tamamen ilgisiz sitelere, diğerleri ise sadece devasadır ve ayrı ayrı listelenmiş binlerce farklı URL’ye sahiptir. İşte talihsiz bir örnek. Site normalde taramam için isteklidir:

Ardından, yüksek kullanıcı trafiğinin olduğu yoğun bir dönemde, site robots.txt dosyasını kısıtlayıcı bir şeye dönüştürür:

Yukarıdaki robots.txt dosya değiştirme işleminin sorunu, kısıtlayıcı robots.txt dosyasını gördüğümde, dizinde zaten taradığım içeriği atmaya başlamam gerekebilmesidir. Ve siteyi tekrar taramama izin verildiğinde birçok içeriği yeniden taramam gerekir. En azından bir 503 yanıt kodu geçici olurdu.

Genellikle robots.txt dosyasını günde sadece bir kez yeniden kontrol ederim (aksi takdirde birçok sanal barındırma sitesinde, getirmelerimin büyük bir kısmını sadece robots.txt’yi alarak harcardım ve hiçbir randevu o kadar sık “ebeveynlerle tanışmak” istemez). Web yöneticileri için, tarama hızını robots.txt değiştirme yoluyla kontrol etmeye çalışmak genellikle ters teper. Hızı Web Yöneticisi Araçları’nda “daha yavaş” olarak ayarlamak daha iyidir.

Googlebot: Web sitesi, tüm soruların için teşekkürler, harikaydın ama “FIN, aşkım” demek zorundayım.

Web Sitesi: Ah, Googlebot… ACK/FIN. 🙂


Alien Road

Biz bunu nasıl uyguluyoruz

Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.

İlgili hizmetler

Paylaş

© Copyright 2026 Alien Road. All rights reserved.