Googlebot ist der allgemeine Name für zwei Arten von Web-Crawlern, die von der Google Suche verwendet werden:
- Googlebot Smartphone: ein mobiler Crawler, der einen Nutzer auf einem Mobilgerät simuliert.
- Googlebot Desktop: ein Desktop-Crawler, der einen Nutzer auf einem Desktop-Computer simuliert.
Sie können den Subtyp des Googlebot identifizieren, indem Sie den HTTP user-agent-Anfrage-Header in der Anfrage prüfen. Beide Crawler-Typen befolgen jedoch dasselbe Produkt-Token (User-Agent-Token) in der robots.txt. Daher können Sie weder Googlebot Smartphone noch Googlebot Desktop selektiv über die robots.txt ansteuern.
Für die meisten Websites indexiert die Google Suche primär die mobile Version der Inhalte. Daher erfolgt die Mehrheit der Googlebot-Crawl-Anfragen über den mobilen Crawler und nur ein kleiner Teil über den Desktop-Crawler.
Wie Googlebot auf Ihre Website zugreift
Für die meisten Websites sollte Googlebot im Durchschnitt nicht häufiger als alle paar Sekunden auf Ihre Seite zugreifen. Aufgrund von Verzögerungen kann die Rate über kurze Zeiträume jedoch leicht erhöht erscheinen. Wenn Ihre Website Schwierigkeiten hat, mit den Crawling-Anfragen von Google Schritt zu halten, können Sie die Crawl-Rate reduzieren.
Beim Crawlen für die Google Suche erfasst Googlebot die ersten 2 MB eines unterstützten Dateityps und die ersten 64 MB einer PDF-Datei. Aus Rendering-Sicht wird jede im HTML referenzierte Ressource (wie CSS und JavaScript) separat abgerufen, wobei für jeden Ressourcenabruf dasselbe Dateigrößenlimit gilt wie für andere Dateien (außer bei PDF-Dateien).
Sobald das Limit erreicht ist, stoppt Googlebot den Abruf und sendet nur den bereits heruntergeladenen Teil der Datei zur Indexierung. Das Dateigrößenlimit bezieht sich auf die unkomprimierten Daten. Andere Google-Crawler, wie zum Beispiel Googlebot Video und Googlebot Image, können abweichende Limits haben.
Beim Crawlen von IP-Adressen in den USA ist die Zeitzone von Googlebot Pacific Time.
Weitere technische Eigenschaften von Googlebot sind in der Übersicht der Google-Crawler beschrieben.
Googlebot den Zugriff auf Ihre Website verwehren
Googlebot entdeckt neue URLs zum Crawlen primär über Links, die in bereits gecrawlten Seiten eingebettet sind. Es ist nahezu unmöglich, eine Website geheim zu halten, indem man keine Links darauf veröffentlicht. Sobald beispielsweise jemand von Ihrer „geheimen“ Website auf eine andere Seite klickt, kann die URL Ihrer „geheimen“ Website im Referrer-Tag erscheinen und von der anderen Website in deren Referrer-Log gespeichert und veröffentlicht werden.
Wenn Sie verhindern möchten, dass Googlebot Inhalte auf Ihrer Website crawlt, haben Sie verschiedene Optionen. Denken Sie daran, dass es einen Unterschied zwischen Crawlen und Indexieren gibt; das Blockieren von Googlebot beim Crawlen einer Seite verhindert nicht, dass die URL der Seite in den Suchergebnissen erscheint:
- Googlebot am Crawlen einer Seite hindern? Verwenden Sie eine robots.txt-Datei.
- Soll Google eine Seite nicht indexieren? Verwenden Sie
noindex. - Verhindern, dass eine Seite für Crawler oder Nutzer zugänglich ist? Verwenden Sie eine andere Methode, wie z. B. Passwortschutz.
Das Blockieren von Googlebot wirkt sich auf die Google Suche (einschließlich Discover und alle Google-Suchfunktionen) sowie auf andere Produkte wie Google Bilder, Google Video und Google News aus.
Googlebot verifizieren
Bevor Sie sich entscheiden, Googlebot zu blockieren, beachten Sie, dass der von Googlebot verwendete HTTP user-agent-Anfrage-Header häufig von anderen Crawlern gefälscht wird. Es ist wichtig zu verifizieren, dass eine problematische Anfrage tatsächlich von Google stammt. Der beste Weg, um zu prüfen, ob eine Anfrage tatsächlich von Googlebot kommt, ist die Verwendung einer Reverse-DNS-Abfrage für die Quell-IP der Anfrage oder der Abgleich der Quell-IP mit den Googlebot-IP-Bereichen.
So setzen wir das um
Knowing exactly which Googlebot variant hit a URL is what makes log analysis useful. We segment logs by user agent so mobile crawl coverage can be measured separately from desktop.
Verwandte Leistungen