Mardi 3 décembre 2024
Vous avez peut-être entendu dire que la recherche Google doit effectuer un certain travail avant qu’une page web puisse apparaître dans les résultats de recherche Google. L’une de ces étapes s’appelle l’exploration (crawling). L’exploration pour la recherche Google est effectuée par Googlebot, un programme s’exécutant sur les serveurs de Google qui récupère une URL et gère des éléments tels que les erreurs réseau, les redirections et d’autres petites complications qu’il pourrait rencontrer en parcourant le web. Mais il existe quelques détails dont on parle peu. Chaque semaine ce mois-ci, nous allons explorer certains de ces détails, car ils peuvent avoir un effet significatif sur la façon dont vos sites sont explorés.
Revenons un peu en arrière : qu’est-ce que l’exploration ?
L’exploration est le processus de découverte de nouvelles pages web et de revisite des pages mises à jour, ainsi que leur téléchargement. En bref, Googlebot obtient une URL, effectue une requête HTTP vers le serveur qui l’héberge, puis traite la réponse de ce serveur, en suivant éventuellement les redirections, en gérant les erreurs et en transmettant le contenu de la page au système d’indexation de Google.
Mais les pages web modernes ne sont pas uniquement composées de HTML pur, alors qu’en est-il des autres ressources qui constituent une page ? Comment l’exploration de ces ressources affecte-t-elle le “budget d’exploration” (crawl budget) ? Ces ressources sont-elles mises en cache du côté de Google ? Et y a-t-il une différence entre les URL qui n’ont pas encore été explorées et celles qui sont déjà indexées ? Dans cet article, nous allons répondre à ces questions, et plus encore !
Googlebot et l’exploration des ressources de page
Au-delà du HTML, les sites web modernes utilisent une combinaison de différentes technologies telles que JavaScript et CSS pour offrir aux utilisateurs des expériences dynamiques et des fonctionnalités utiles. Lors de l’accès à ces pages avec un navigateur, celui-ci télécharge d’abord l’URL parente qui héberge les données nécessaires pour commencer à construire la page pour l’utilisateur — le HTML de la page. Ces données initiales peuvent contenir des références à des ressources comme JavaScript et CSS, mais aussi des images et des vidéos que le navigateur téléchargera à nouveau pour finalement construire la page finale qui est ensuite présentée à l’utilisateur.
Google fait exactement la même chose, bien que légèrement différemment :
- Googlebot télécharge les données initiales de l’URL parente — le HTML de la page.
- Googlebot transmet les données récupérées au Web Rendering Service (WRS).
- En utilisant Googlebot, le WRS télécharge les ressources référencées dans les données originales.
- Le WRS construit la page en utilisant toutes les ressources téléchargées, comme le ferait le navigateur d’un utilisateur.
Par rapport à un navigateur, le temps entre chaque étape peut être nettement plus long en raison de contraintes de planification, telles que la charge perçue du serveur hébergeant les ressources nécessaires au rendu d’une page. Et c’est là que le
budget d’exploration
entre en jeu.
L’exploration des ressources nécessaires au rendu d’une page consommera une partie du budget d’exploration du nom d’hôte qui héberge la ressource. Pour améliorer cela, le WRS tente de mettre en cache chaque ressource (JavaScript et CSS) référencée dans les pages qu’il rend. La durée de vie du cache WRS n’est pas affectée par les directives de mise en cache HTTP ; au lieu de cela, le WRS met tout en cache jusqu’à 30 jours, ce qui aide à préserver le budget d’exploration du site pour d’autres tâches d’exploration.
Du point de vue des propriétaires de sites, gérer comment et quelles ressources sont explorées peut influencer le budget d’exploration du site ; nous recommandons :
- Utilisez le moins de ressources possible pour offrir aux utilisateurs une excellente expérience ; moins il y a de ressources nécessaires pour le rendu d’une page, moins le budget d’exploration est dépensé lors du rendu.
- Utilisez les paramètres de cache-busting avec prudence : si les URL des ressources changent, Google peut avoir besoin d’explorer à nouveau les ressources, même si leur contenu n’a pas changé. Cela consommera, bien entendu, du budget d’exploration.
- Hébergez les ressources sur un nom d’hôte différent de celui du site principal, par exemple en utilisant un CDN ou simplement en hébergeant les ressources sur un sous-domaine différent. Cela déplacera les préoccupations liées au budget d’exploration vers l’hôte qui sert les ressources.
Tous ces points s’appliquent également aux ressources multimédias. Si Googlebot (ou plus spécifiquement, Googlebot-Image et Googlebot-Video respectivement) les récupère, cela consommera le budget d’exploration du site.
Il est tentant d’ajouter également le robots.txt à la liste, cependant, du point de vue du rendu, interdire l’exploration des ressources cause généralement des problèmes. Si le WRS ne peut pas récupérer une ressource critique pour le rendu, la recherche Google peut avoir du mal à extraire le contenu de la page et à permettre à la page d’être classée dans la recherche.
Qu’est-ce que Googlebot explore ?
La meilleure source pour analyser quelles ressources Google explore est constituée par les journaux d’accès bruts du site, qui contiennent une entrée pour chaque URL demandée par les navigateurs comme par les robots d’exploration. Pour identifier les robots d’exploration de Google dans le journal d’accès, nous publions nos
plages d’adresses IP dans notre documentation pour développeurs.
La deuxième meilleure ressource est, bien sûr, le
rapport sur les statistiques d’exploration de la Search Console, qui détaille chaque type de ressource par robot d’exploration :

Enfin, si vous êtes vraiment passionné par l’exploration et le rendu et que vous souhaitez en discuter avec d’autres, la
communauté Search Central est l’endroit idéal, mais vous pouvez également nous trouver sur
LinkedIn.
Mises à jour
- Mise à jour du 6 décembre 2024 : Note sur l’impact sur les performances du service de ressources à partir d’une origine différente.
Vous voulez en savoir plus sur l’exploration ? Découvrez toute la série Crawling December :
Comment nous l'appliquons
Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.
Services associés