{"id":25334,"date":"2024-12-03T00:00:00","date_gmt":"2024-12-03T00:00:00","guid":{"rendered":"https:\/\/alienroad.com\/google-bilgi-bankasi\/crawling-december-the-how-and-why-of-googlebot-crawling\/"},"modified":"2024-12-03T00:00:00","modified_gmt":"2024-12-03T00:00:00","slug":"crawling-december-the-how-and-why-of-googlebot-crawling","status":"publish","type":"ar_kb","link":"https:\/\/alienroad.com\/google-bilgi-bankasi\/crawling-december-the-how-and-why-of-googlebot-crawling\/","title":{"rendered":"D\u00e9cembre sous la loupe : le comment et le pourquoi du crawl de Googlebot"},"content":{"rendered":"<p class=\"gargardate\">Mardi 3 d\u00e9cembre 2024<\/p>\n<p>\n  Vous avez peut-\u00eatre entendu dire que la recherche Google doit effectuer un certain travail avant qu&#8217;une page web puisse appara\u00eetre dans les r\u00e9sultats de recherche Google. L&#8217;une de ces \u00e9tapes s&#8217;appelle l&#8217;exploration (crawling). L&#8217;exploration pour la recherche Google est effectu\u00e9e par Googlebot, un programme s&#8217;ex\u00e9cutant sur les serveurs de Google qui r\u00e9cup\u00e8re une URL et g\u00e8re des \u00e9l\u00e9ments tels que les erreurs r\u00e9seau, les redirections et d&#8217;autres petites complications qu&#8217;il pourrait rencontrer en parcourant le web. Mais il existe quelques d\u00e9tails dont on parle peu. Chaque semaine ce mois-ci, nous allons explorer certains de ces d\u00e9tails, car ils peuvent avoir un effet significatif sur la fa\u00e7on dont vos sites sont explor\u00e9s.\n<\/p>\n<h2 id=\"backing-up-a-little:-what-is-crawling\" tabindex=\"-1\">Revenons un peu en arri\u00e8re : qu&#8217;est-ce que l&#8217;exploration ?<\/h2>\n<p>\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/how-search-works\/#crawling\">L&#8217;exploration<\/a> est le processus de d\u00e9couverte de nouvelles pages web et de revisite des pages mises \u00e0 jour, ainsi que leur t\u00e9l\u00e9chargement. En bref, Googlebot obtient une URL, effectue une requ\u00eate HTTP vers le serveur qui l&#8217;h\u00e9berge, puis traite la r\u00e9ponse de ce serveur, en suivant \u00e9ventuellement les redirections, en g\u00e9rant les erreurs et en transmettant le contenu de la page au syst\u00e8me d&#8217;indexation de Google.\n<\/p>\n<p>\n  Mais les pages web modernes ne sont pas uniquement compos\u00e9es de HTML pur, alors qu&#8217;en est-il des autres ressources qui constituent une page ? Comment l&#8217;exploration de ces ressources affecte-t-elle le &#8220;budget d&#8217;exploration&#8221; (crawl budget) ? Ces ressources sont-elles mises en cache du c\u00f4t\u00e9 de Google ? Et y a-t-il une diff\u00e9rence entre les URL qui n&#8217;ont pas encore \u00e9t\u00e9 explor\u00e9es et celles qui sont d\u00e9j\u00e0 index\u00e9es ? Dans cet article, nous allons r\u00e9pondre \u00e0 ces questions, et plus encore !\n<\/p>\n<h2 id=\"googlebot-and-crawling-page-resources\" tabindex=\"-1\">Googlebot et l&#8217;exploration des ressources de page<\/h2>\n<p>\n  Au-del\u00e0 du HTML, les sites web modernes utilisent une combinaison de diff\u00e9rentes technologies telles que JavaScript et CSS pour offrir aux utilisateurs des exp\u00e9riences dynamiques et des fonctionnalit\u00e9s utiles. Lors de l&#8217;acc\u00e8s \u00e0 ces pages avec un navigateur, celui-ci t\u00e9l\u00e9charge d&#8217;abord l&#8217;URL parente qui h\u00e9berge les donn\u00e9es n\u00e9cessaires pour commencer \u00e0 construire la page pour l&#8217;utilisateur \u2014 le HTML de la page. Ces donn\u00e9es initiales peuvent contenir des r\u00e9f\u00e9rences \u00e0 des ressources comme JavaScript et CSS, mais aussi des images et des vid\u00e9os que le navigateur t\u00e9l\u00e9chargera \u00e0 nouveau pour finalement construire la page finale qui est ensuite pr\u00e9sent\u00e9e \u00e0 l&#8217;utilisateur.\n<\/p>\n<p>\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/javascript-seo-basics\/\">Google fait exactement la m\u00eame chose<\/a>, bien que l\u00e9g\u00e8rement diff\u00e9remment :\n<\/p>\n<ol>\n<li>Googlebot t\u00e9l\u00e9charge les donn\u00e9es initiales de l&#8217;URL parente \u2014 le HTML de la page.<\/li>\n<li>Googlebot transmet les donn\u00e9es r\u00e9cup\u00e9r\u00e9es au Web Rendering Service (WRS).<\/li>\n<li>En utilisant Googlebot, le WRS t\u00e9l\u00e9charge les ressources r\u00e9f\u00e9renc\u00e9es dans les donn\u00e9es originales.<\/li>\n<li>Le WRS construit la page en utilisant toutes les ressources t\u00e9l\u00e9charg\u00e9es, comme le ferait le navigateur d&#8217;un utilisateur.<\/li>\n<\/ol>\n<p>\n  Par rapport \u00e0 un navigateur, le temps entre chaque \u00e9tape peut \u00eatre nettement plus long en raison de contraintes de planification, telles que la charge per\u00e7ue du serveur h\u00e9bergeant les ressources n\u00e9cessaires au rendu d&#8217;une page. Et c&#8217;est l\u00e0 que le<br \/>\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/troubleshoot-google-search-crawling-errors\/#general_theory\">budget d&#8217;exploration<\/a><br \/>\n  entre en jeu.\n<\/p>\n<p>\n  L&#8217;exploration des ressources n\u00e9cessaires au rendu d&#8217;une page consommera une partie du budget d&#8217;exploration du nom d&#8217;h\u00f4te qui h\u00e9berge la ressource. Pour am\u00e9liorer cela, le WRS tente de mettre en cache chaque ressource (JavaScript et CSS) r\u00e9f\u00e9renc\u00e9e dans les pages qu&#8217;il rend. La dur\u00e9e de vie du cache WRS n&#8217;est pas affect\u00e9e par les directives de mise en cache HTTP ; au lieu de cela, le WRS met tout en cache jusqu&#8217;\u00e0 30 jours, ce qui aide \u00e0 pr\u00e9server le budget d&#8217;exploration du site pour d&#8217;autres t\u00e2ches d&#8217;exploration.\n<\/p>\n<p>\n  Du point de vue des propri\u00e9taires de sites, g\u00e9rer comment et quelles ressources sont explor\u00e9es peut influencer le budget d&#8217;exploration du site ; nous recommandons :\n<\/p>\n<ol>\n<li>\n    <strong>Utilisez le moins de ressources possible<\/strong> pour offrir aux utilisateurs une excellente exp\u00e9rience ; moins il y a de ressources n\u00e9cessaires pour le rendu d&#8217;une page, moins le budget d&#8217;exploration est d\u00e9pens\u00e9 lors du rendu.\n  <\/li>\n<li>\n    <strong>Utilisez les param\u00e8tres de cache-busting avec prudence<\/strong> : si les URL des ressources changent, Google peut avoir besoin d&#8217;explorer \u00e0 nouveau les ressources, m\u00eame si leur contenu n&#8217;a pas chang\u00e9. Cela consommera, bien entendu, du budget d&#8217;exploration.\n  <\/li>\n<li>\n    <strong>H\u00e9bergez les ressources sur un nom d&#8217;h\u00f4te diff\u00e9rent<\/strong> de celui du site principal, par exemple en utilisant un CDN ou simplement en h\u00e9bergeant les ressources sur un sous-domaine diff\u00e9rent. Cela d\u00e9placera les pr\u00e9occupations li\u00e9es au budget d&#8217;exploration vers l&#8217;h\u00f4te qui sert les ressources.<\/p>\n<aside class=\"note\"><strong>Mise \u00e0 jour du 6 d\u00e9cembre 2024 :<\/strong> Cela peut entra\u00eener des performances de page plus lentes en raison de la surcharge de connexion \u00e0 un nom d&#8217;h\u00f4te diff\u00e9rent, nous ne<br \/>\n    <a href=\"https:\/\/web.dev\/articles\/optimize-lcp#different-origin\" class=\"external-link\">recommandons donc pas cette strat\u00e9gie pour les ressources critiques<\/a> (telles que JavaScript ou CSS) n\u00e9cessaires au rendu d&#8217;une page. Cependant, pour des ressources plus volumineuses non critiques telles que la vid\u00e9o ou les t\u00e9l\u00e9chargements, cette approche m\u00e9rite d&#8217;\u00eatre envisag\u00e9e.<\/aside>\n<\/li>\n<\/ol>\n<p>\n  Tous ces points s&#8217;appliquent \u00e9galement aux ressources multim\u00e9dias. Si Googlebot (ou plus sp\u00e9cifiquement, <code>Googlebot-Image<\/code> et <code>Googlebot-Video<\/code> respectivement) les r\u00e9cup\u00e8re, cela consommera le budget d&#8217;exploration du site.\n<\/p>\n<p>\n  Il est tentant d&#8217;ajouter \u00e9galement le <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/robots-txt-intro\/\">robots.txt<\/a> \u00e0 la liste, cependant, du point de vue du rendu, interdire l&#8217;exploration des ressources cause g\u00e9n\u00e9ralement des probl\u00e8mes. Si le WRS ne peut pas r\u00e9cup\u00e9rer une ressource critique pour le rendu, la recherche Google peut avoir du mal \u00e0 extraire le contenu de la page et \u00e0 permettre \u00e0 la page d&#8217;\u00eatre class\u00e9e dans la recherche.\n<\/p>\n<h2 id=\"what-is-googlebot-crawling\" tabindex=\"-1\">Qu&#8217;est-ce que Googlebot explore ?<\/h2>\n<p>\n  La meilleure source pour analyser quelles ressources Google explore est constitu\u00e9e par les journaux d&#8217;acc\u00e8s bruts du site, qui contiennent une entr\u00e9e pour chaque URL demand\u00e9e par les navigateurs comme par les robots d&#8217;exploration. Pour identifier les robots d&#8217;exploration de Google dans le journal d&#8217;acc\u00e8s, nous publions nos<br \/>\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/google-crawlers\/\">plages d&#8217;adresses IP dans notre documentation pour d\u00e9veloppeurs<\/a>.\n<\/p>\n<p>\n  La deuxi\u00e8me meilleure ressource est, bien s\u00fbr, le<br \/>\n  <a href=\"https:\/\/support.google.com\/webmasters\/answer\/9679690\" class=\"external-link\">rapport sur les statistiques d&#8217;exploration de la Search Console<\/a>, qui d\u00e9taille chaque type de ressource par robot d&#8217;exploration :\n<\/p>\n<p><img decoding=\"async\" src=\"https:\/\/alienroad.com\/wp-content\/uploads\/kb-gorsel\/g-a6f6a676fb47.png\" loading=\"lazy\" alt=\"Le rapport sur les statistiques d&apos;exploration dans la Search Console montrant les diff\u00e9rents types de ressources explor\u00e9es par Googlebot\" \/><\/p>\n<p>\n  Enfin, si vous \u00eates vraiment passionn\u00e9 par l&#8217;exploration et le rendu et que vous souhaitez en discuter avec d&#8217;autres, la<br \/>\n  <a href=\"https:\/\/goo.gle\/sc-forum\" class=\"external-link\">communaut\u00e9 Search Central<\/a> est l&#8217;endroit id\u00e9al, mais vous pouvez \u00e9galement nous trouver sur<br \/>\n  <a href=\"https:\/\/www.linkedin.com\/showcase\/googlesearchcentral\/\" class=\"external-link\">LinkedIn<\/a>.\n<\/p>\n<p class=\"byline-author\">\n  Publi\u00e9 par<br \/>\n  <a href=\"https:\/\/developers.google.com\/search\/blog\/authors\/martin-splitt\">Martin Splitt<\/a> et<br \/>\n  <a href=\"https:\/\/developers.google.com\/search\/blog\/authors\/gary-illyes\">Gary Illyes<\/a>\n<\/p>\n<hr>\n<h2 id=\"updates\" tabindex=\"-1\">\n    Mises \u00e0 jour<br \/>\n<\/h2>\n<ul>\n<li><b>Mise \u00e0 jour du 6 d\u00e9cembre 2024<\/b> : Note sur l&#8217;impact sur les performances du service de ressources \u00e0 partir d&#8217;une origine diff\u00e9rente.<\/li>\n<\/ul>\n<hr class=\"full-width\">\n<h2 id=\"want-to-learn-more-about-crawling-check-out-the-entire-crawling-december-series:\" tabindex=\"-1\">Vous voulez en savoir plus sur l&#8217;exploration ? D\u00e9couvrez toute la s\u00e9rie Crawling December :<\/h2>\n","protected":false},"excerpt":{"rendered":"<p>Mardi 3 d\u00e9cembre 2024 Vous avez peut-\u00eatre entendu dire que la recherche Google doit effectuer un certain travail avant qu&#8217;une page web puisse appara\u00eetre dans les r\u00e9sultats de recherche Google. L&#8217;une de ces \u00e9tapes s&#8217;appelle l&#8217;exploration (crawling). L&#8217;exploration pour la recherche Google est effectu\u00e9e par Googlebot, un programme s&#8217;ex\u00e9cutant sur les serveurs de Google qui [&hellip;]<\/p>\n","protected":false},"menu_order":79940,"template":"","meta":{"footnotes":""},"ar_kb_kategori":[665],"ar_kb_etiket":[],"class_list":["post-25334","ar_kb","type-ar_kb","status-publish","has-post-thumbnail","hentry","ar_kb_kategori-blog"],"_links":{"self":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb\/25334","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb"}],"about":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/types\/ar_kb"}],"version-history":[{"count":0,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb\/25334\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/media\/27454"}],"wp:attachment":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/media?parent=25334"}],"wp:term":[{"taxonomy":"ar_kb_kategori","embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb_kategori?post=25334"},{"taxonomy":"ar_kb_etiket","embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb_etiket?post=25334"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}