Blog

HTML formlarını taramak

11 Nisan 2008, Cuma

Google, web kapsamımızı iyileştirmek için sürekli yeni fikirler deniyor. Yeni web sayfalarına giden bağlantıları keşfetmek adına JavaScript ve Flash taramak gibi oldukça akıllıca işler yapıyoruz ve bugün, yakın zamanda denemeye başladığımız yeni bir teknolojiden bahsetmek istiyoruz.

Geçtiğimiz birkaç ay içinde, Google’da arama yapan kullanıcılar için başka türlü bulup dizine ekleyemeyeceğimiz yeni web sayfalarını ve URL’leri keşfetmek amacıyla bazı HTML formlarını inceliyoruz. Özellikle, yüksek kaliteli bir sitede bir <form> öğesiyle karşılaştığımızda, formu kullanarak az sayıda sorgu yapmayı tercih edebiliyoruz. Metin kutuları için bilgisayarlarımız, formun bulunduğu siteden otomatik olarak kelimeler seçiyor; formdaki seçim menüleri, onay kutuları ve radyo düğmeleri için ise HTML değerleri arasından seçim yapıyoruz. Her giriş için değerleri belirledikten sonra, bir kullanıcının yapmış olabileceği olası bir sorguya karşılık gelen URL’leri oluşturuyor ve taramaya çalışıyoruz. Sorgumuzdan elde edilen web sayfasının geçerli, ilgi çekici olduğunu ve dizinimizde bulunmayan içerikler barındırdığını tespit edersek, onu tıpkı diğer web sayfalarını dahil ettiğimiz gibi dizinimize dahil edebiliyoruz.

Söylemeye gerek yok ki, bu deney iyi internet vatandaşlığı uygulamalarını takip ediyor. Sadece özellikle yararlı olan az sayıda site bu işleme tabi tutuluyor ve tarama aracımız olan her zaman dost canlısı Googlebot, robots.txt, nofollow ve noindex kurallarına her zaman bağlı kalıyor. Bu, bir arama formu robots.txt dosyasında yasaklanmışsa, formun oluşturabileceği hiçbir URL’yi taramayacağımız anlamına gelir. Benzer şekilde, yalnızca GET formlarını alıyor ve herhangi bir kullanıcı bilgisi gerektiren formlardan kaçınıyoruz. Örneğin, parola girişi olan veya giriş bilgileri, kullanıcı kimlikleri, iletişim bilgileri vb. gibi kişisel bilgilerle yaygın olarak ilişkilendirilen terimleri kullanan tüm formları hariç tutuyoruz. Ayrıca web siteleri üzerinde yaratabileceğimiz etkinin bilincindeyiz ve belirli bir site için kendimizi çok az sayıda getirme işlemiyle sınırlandırıyoruz.

Geliştirilmiş taramamızda keşfettiğimiz web sayfaları, halihazırda taramanın bir parçası olan normal web sayfalarının zararına değildir; dolayısıyla bu değişiklik diğer sayfalarınızın PageRank değerini düşürmez. Bu nedenle, yalnızca sitenizin Google’daki görünürlüğünü artıracaktır. Bu değişiklik ayrıca diğer web sayfalarının taranmasını, sıralanmasını veya seçilmesini önemli ölçüde etkilemez.

Bu deney, Google’ın web kapsamını genişletmeye yönelik daha geniş çabasının bir parçasıdır. Aslında, HTML formlarının uzun zamandır arama motorlarının normal kapsamının ötesindeki büyük veri hacimlerine açılan kapı olduğu düşünülmektedir. Derin Web (Deep Web), Gizli Web (Hidden Web) veya Görünmez Web (Invisible Web) terimleri, şimdiye kadar arama motoru kullanıcıları için görünmez olan bu tür içerikleri ifade etmek için topluca kullanılmıştır. HTML formlarını kullanarak (ve robots.txt kurallarına uyarak) tarama yaparak, arama motoru kullanıcılarını başka türlü kolayca bulunamayacak belgelere yönlendirebiliyor ve hem web yöneticilerine hem de kullanıcılara daha iyi ve daha kapsamlı bir arama deneyimi sunabiliyoruz.

Alien Road

Biz bunu nasıl uyguluyoruz

We archive Search Central announcements because client questions often trace back to a change that was announced years ago. Reading the original is faster than reconstructing it from second-hand summaries.

İlgili hizmetler

Paylaş

© Copyright 2026 Alien Road. All rights reserved.