31 Mart 2026, Salı
Eğer
Search Off the Record podcast’inin 105. bölümünüdinlediyseniz, kalbimize (ve sunucularımıza) çok yakın bir konunun derinliklerine indiğimizi duymuş olabilirsiniz: Googlebot’un işleyişi.
Uzun bir süre boyunca “Googlebot” ismi, interneti sistematik bir şekilde okuyan tek ve yorulmak bilmez bir robot imajı yarattı. Ancak gerçek biraz daha karmaşık ve çok daha ilginç. Bugün, tarama altyapımızın kapağını açmak ve kendi başımızı döndüren o özel konuya, yani bayt boyutu sınırlarına odaklanmak istiyoruz.
Öncelikle, Googlebot tek bir program değildir
Önce tarihsel bir yanlış adlandırmayı düzeltelim. 2000’lerin başında Google’ın tek bir ürünü vardı, bu yüzden tek bir tarayıcımız vardı. “Googlebot” ismi de öyle kaldı. Ancak bugün Googlebot, merkezi bir tarama platformuna benzeyen bir yapının sadece bir kullanıcısıdır.
Sunucu günlüklerinizde Googlebot’u gördüğünüzde, aslında sadece Google Arama’yı görüyorsunuz demektir. Google Alışveriş, AdSense ve daha pek çok istemci, tarama isteklerini farklı tarayıcı isimleri altında aynı temel altyapı üzerinden yönlendirir; bunların büyük olanları
Google Tarayıcı altyapısı sitesinde.
2MB sınırı: baytlarınıza ne oluyor?
İşte işlerin biraz kafa karıştırıcı olduğu nokta burası. Tarayıcı altyapısının her istemcisi, getirme işlemleri için bazı ayarlar belirlemelidir. Bu ayarlar arasında kullanıcı aracısı (user agent) dizesi, robots.txt dosyasında hangi kullanıcı aracısı belirteçlerinin aranacağı ve tek bir URL’den kaç bayt getirileceği yer alır.
Googlebot şu anda herhangi bir URL için (PDF’ler hariç) 2MB’a kadar veri getirir. Bu, HTTP başlığı dahil olmak üzere bir kaynağın yalnızca ilk 2MB’ını taradığı anlamına gelir. PDF dosyaları için sınır 64MB’tır.
Görsel ve video tarayıcıları genellikle geniş bir eşik değeri aralığına sahiptir ve bu büyük ölçüde veri çektikleri ürüne bağlıdır. Örneğin, bir favicon getirmek, Görsel Arama’ya kıyasla çok daha düşük bir sınıra sahip olabilir.
Sınır belirtmeyen diğer tüm tarayıcılar için varsayılan değer, içerik türünden bağımsız olarak 15MB’tır.
Bu, sunucunuzun ağ üzerinden gönderdiği baytlar için ne anlama geliyor?
- Kısmi getirme: HTML dosyanız 2MB’tan büyükse, Googlebot sayfayı reddetmez. Bunun yerine, getirme işlemini tam olarak 2MB sınırında durdurur. Sınırın HTTP istek başlıklarını da içerdiğini unutmayın.
- Sınırın işlenmesi: İndirilen bu kısım (ilk 2MB bayt), sanki dosyanın tamamıymış gibi dizin oluşturma sistemlerimize ve Web İşleme Hizmetimize (WRS) aktarılır.
- Görünmeyen baytlar: Bu 2MB eşik değerinden sonra var olan tüm baytlar tamamen göz ardı edilir. Getirilmezler, işlenmezler ve dizine eklenmezler.
- Kaynakları dahil etme: HTML’de referans verilen her kaynak (medya, yazı tipleri ve birkaç egzotik dosya hariç), WRS tarafından Googlebot ile ana HTML gibi getirilecektir. Bunların kendilerine ait, ayrı, URL başına bayt sayaçları vardır ve ana sayfanın boyutuna dahil edilmezler.
İnternetin büyük çoğunluğu için 2MB’lık bir HTML yükü devasadır ve bu sınıra asla ulaşmazsınız. Ancak, sayfanız şişirilmiş satır içi base64 görseller, devasa satır içi CSS/JavaScript blokları içeriyorsa veya megabaytlarca menü ile başlıyorsa, gerçek metin içeriğinizi veya kritik yapılandırılmış verilerinizi yanlışlıkla 2MB sınırının ötesine itebilirsiniz. Eğer bu kritik baytlar getirilmezse, Googlebot için bunlar basitçe yok hükmündedir.
Baytları işleme
Tarayıcı baytları başarıyla aldıktan sonra (sınıra kadar), görevi WRS’ye devreder. WRS, sayfanın nihai görsel ve metinsel durumunu anlamak için modern bir tarayıcıya benzer şekilde JavaScript’i işler ve istemci tarafı kodlarını çalıştırır. İşleme süreci, sayfanın metin içeriğini ve yapısını daha iyi anlamak için JavaScript ve CSS dosyalarını çeker, çalıştırır ve XHR isteklerini işler (görsel veya video dosyalarını talep etmez). Talep edilen her kaynak için 2MB sınırı yine geçerlidir.
Ancak, WRS’nin yalnızca tarayıcının gerçekten getirdiği kodu çalıştırabileceğini unutmayın. Ayrıca,
WRS durumsuz (stateless) çalışır
— istekler arasında yerel depolamayı ve oturum verilerini temizler. Bu, dinamik, JavaScript’e bağımlı öğelerin sistemlerimiz tarafından nasıl yorumlandığı konusunda özel çıkarımlara sahip olabilir.
Baytlarınız için en iyi uygulamalar
Googlebot’un içeriğinizi verimli bir şekilde getirebilmesini ve anlayabilmesini sağlamak için şu bayt düzeyi en iyi uygulamaları aklınızda bulundurun:
- HTML’nizi yalın tutun: Ağır CSS ve JavaScript’i harici dosyalara taşıyın. İlk HTML belgesi 2MB ile sınırlandırılmış olsa da, harici betikler ve stil sayfaları ayrı ayrı getirilir (kendi sınırlarına tabidirler).
- Sıralama önemlidir: Meta etiketleri,
<title>öğeleri,
<link>öğeleri, canonical etiketleri ve temel yapılandırılmış veriler gibi en kritik öğelerinizi HTML belgesinde daha yukarıya yerleştirin. Bu, bunların sınırın altında kalma olasılığını düşürür. - Sunucu günlüklerinizi izleyin: Sunucu yanıt sürelerinize göz kulak olun. Sunucunuz bayt sunmakta zorlanıyorsa, tarayıcılarımız altyapınızı aşırı yüklememek için otomatik olarak geri çekilecek ve bu da tarama sıklığınızı düşürecektir.
Bu sınırın kesin olmadığını ve internet geliştikçe ve HTML sayfaları büyüdükçe (veya küçüldükçe; umarız küçülür) zamanla değişebileceğini unutmayın.
Tarama sihir değildir; yüksek oranda düzenlenmiş, ölçeklendirilmiş bir bayt alışverişidir. Merkezi getirme altyapımızın bu baytları nasıl aldığını ve sınırladığını anlayarak, sitenizin en önemli içeriğinin her zaman sınırın içinde kalmasını sağlayabilirsiniz.
İyi optimizasyonlar!
Daha fazla perde arkası detayı duymak ister misiniz? Şuraya göz atın:
YouTube’da Search Off the Record podcast’inin 105. bölümü
veya podcast’lerinizi dinlediğiniz herhangi bir platform!
Biz bunu nasıl uyguluyoruz
Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.
İlgili hizmetler