Googlebot est le nom générique de deux types de robots d’exploration utilisés par la recherche Google :
- Googlebot Smartphone : un robot d’exploration mobile qui simule un utilisateur sur un appareil mobile.
- Googlebot Desktop : un robot d’exploration de bureau qui simule un utilisateur sur ordinateur.
Vous pouvez identifier le sous-type de Googlebot en examinant l’en-tête de requête HTTP user-agent dans la requête. Cependant, les deux types de robots respectent le même jeton de produit (jeton user-agent) dans le fichier robots.txt ; vous ne pouvez donc pas cibler sélectivement Googlebot Smartphone ou Googlebot Desktop via robots.txt.
Pour la plupart des sites, la recherche Google indexe principalement la version mobile du contenu. Par conséquent, la majorité des requêtes d’exploration de Googlebot seront effectuées par le robot mobile, et une minorité par le robot de bureau.
Comment Googlebot accède à votre site
Pour la plupart des sites, Googlebot ne devrait pas accéder à votre site plus d’une fois toutes les quelques secondes en moyenne. Cependant, en raison de délais, il est possible que le taux semble légèrement plus élevé sur de courtes périodes. Si votre site a du mal à suivre les requêtes d’exploration de Google, vous pouvez réduire la fréquence d’exploration.
Lors de l’exploration pour la recherche Google, Googlebot explore les 2 premiers Mo d’un type de fichier pris en charge, et les 64 premiers Mo d’un fichier PDF. Du point de vue du rendu, chaque ressource référencée dans le HTML (comme le CSS et le JavaScript) est récupérée séparément, et chaque récupération de ressource est soumise à la même limite de taille de fichier que les autres fichiers (à l’exception des fichiers PDF).
Une fois la limite atteinte, Googlebot arrête la récupération et n’envoie que la partie déjà téléchargée du fichier pour examen en vue de l’indexation. La limite de taille de fichier s’applique aux données non compressées. D’autres robots Google, par exemple Googlebot Video et Googlebot Image, peuvent avoir des limites différentes.
Lors de l’exploration depuis des adresses IP aux États-Unis, le fuseau horaire de Googlebot est l’ heure du Pacifique.
D’autres propriétés techniques de Googlebot sont décrites dans l’aperçu des robots d’exploration de Google.
Bloquer l’accès de Googlebot à votre site
Googlebot découvre de nouvelles URL à explorer principalement à partir de liens intégrés dans des pages précédemment explorées. Il est presque impossible de garder un site secret en ne publiant pas de liens vers celui-ci. Par exemple, dès que quelqu’un clique sur un lien depuis votre site “secret” vers un autre site, l’URL de votre site “secret” peut apparaître dans la balise referrer et être stockée et publiée par l’autre site dans son journal de référents.
Si vous souhaitez empêcher Googlebot d’explorer le contenu de votre site, vous disposez d’un certain nombre d’options. N’oubliez pas qu’il existe une différence entre l’exploration et l’indexation ; bloquer Googlebot pour l’exploration d’une page n’empêche pas l’URL de la page d’apparaître dans les résultats de recherche :
- Empêcher Googlebot d’explorer une page ? Utilisez un fichier robots.txt.
- Vous ne voulez pas que Google indexe une page ? Utilisez
noindex. - Empêcher une page d’être accessible par les robots ou les utilisateurs ? Utilisez une autre méthode, comme la protection par mot de passe.
Bloquer Googlebot affecte la recherche Google (y compris Discover et toutes les fonctionnalités de recherche Google), ainsi que d’autres produits tels que Google Images, Google Video et Google News.
Vérifier Googlebot
Avant de décider de bloquer Googlebot, sachez que l’en-tête de requête HTTP user-agent utilisé par Googlebot est souvent usurpé par d’autres robots. Il est important de vérifier qu’une requête problématique provient réellement de Google. La meilleure façon de vérifier qu’une requête provient bien de Googlebot est d’ utiliser une recherche DNS inversée sur l’adresse IP source de la requête, ou de faire correspondre l’adresse IP source avec les plages d’adresses IP de Googlebot.
Comment nous l'appliquons
Knowing exactly which Googlebot variant hit a URL is what makes log analysis useful. We segment logs by user agent so mobile crawl coverage can be measured separately from desktop.
Services associés