{"id":25374,"date":"2026-03-31T00:00:00","date_gmt":"2026-03-31T00:00:00","guid":{"rendered":"https:\/\/alienroad.com\/google-bilgi-bankasi\/inside-googlebot-demystifying-crawling-fetching-and-the-bytes-we-process\/"},"modified":"2026-03-31T00:00:00","modified_gmt":"2026-03-31T00:00:00","slug":"inside-googlebot-demystifying-crawling-fetching-and-the-bytes-we-process","status":"publish","type":"ar_kb","link":"https:\/\/alienroad.com\/google-bilgi-bankasi\/inside-googlebot-demystifying-crawling-fetching-and-the-bytes-we-process\/","title":{"rendered":"Dans les coulisses de Googlebot : d\u00e9mystifier l'exploration, la r\u00e9cup\u00e9ration et les octets que nous traitons"},"content":{"rendered":"\n<p class=\"gargardate wp-block-paragraph\">Mardi 31 mars 2026<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Si vous avez \u00e9cout\u00e9 l&#8217;\n  <a href=\"https:\/\/www.youtube.com\/watch?v=JpweMBnpS4Q\" class=\"external-link\">\u00e9pisode 105 du podcast Search Off the Record<\/a>,\n  vous nous avez peut-\u00eatre entendus aborder en profondeur un sujet qui nous tient \u00e0 c\u0153ur\n  (et qui occupe nos serveurs) : le fonctionnement interne de Googlebot.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Pendant longtemps, le nom &#8220;Googlebot&#8221; a \u00e9voqu\u00e9 l&#8217;image d&#8217;un robot unique et infatigable lisant syst\u00e9matiquement Internet. Mais la r\u00e9alit\u00e9 est un peu plus complexe &mdash; et beaucoup plus int\u00e9ressante. Aujourd&#8217;hui, nous voulons soulever le capot de notre infrastructure de crawl, en nous concentrant sur ce qui nous donne du fil \u00e0 retordre : les limites d&#8217;octets.\n<\/p>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"first,-googlebot-isnt-a-single-program\" tabindex=\"-1\">D&#8217;abord, Googlebot n&#8217;est pas un programme unique<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Clarifions d&#8217;abord une erreur historique. Au d\u00e9but des ann\u00e9es 2000, Google n&#8217;avait qu&#8217;un seul produit, donc un seul crawler. Le nom &#8220;Googlebot&#8221; est rest\u00e9. Mais aujourd&#8217;hui, Googlebot n&#8217;est qu&#8217;un utilisateur de ce qui ressemble \u00e0 une plateforme de crawl centralis\u00e9e.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Lorsque vous voyez Googlebot dans vos logs de serveur, vous regardez simplement Google Search. Des dizaines d&#8217;autres clients &mdash; Google Shopping, AdSense, et plus encore &mdash; acheminent toutes leurs requ\u00eates de crawl via cette m\u00eame infrastructure sous-jacente avec des noms de crawlers diff\u00e9rents, les plus importants \u00e9tant document\u00e9s sur le\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/overview-of-google-crawlers-and-fetchers-user-agents\/\" class=\"external-link\">site de l&#8217;infrastructure Google Crawler<\/a>.\n<\/p>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"the-2mb-limit:-what-happens-to-your-bytes\" tabindex=\"-1\">La limite de 2 Mo : que deviennent vos octets ?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">\n  C&#8217;est l\u00e0 que les choses deviennent confuses. Chaque client de l&#8217;infrastructure de crawl doit d\u00e9finir des param\u00e8tres pour ses r\u00e9cup\u00e9rations. Ces param\u00e8tres incluent la cha\u00eene user agent, les jetons user agent recherch\u00e9s dans le robots.txt, et le nombre d&#8217;octets r\u00e9cup\u00e9r\u00e9s pour une seule URL.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Googlebot r\u00e9cup\u00e8re actuellement jusqu&#8217;\u00e0 2 Mo pour toute URL individuelle (hors PDF). Cela signifie qu&#8217;il ne crawl que les 2 premiers Mo d&#8217;une ressource, en incluant l&#8217;en-t\u00eate HTTP. Pour les fichiers PDF, la limite est de 64 Mo.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Les crawlers d&#8217;images et de vid\u00e9os ont g\u00e9n\u00e9ralement des seuils vari\u00e9s, qui d\u00e9pendent largement du produit pour lequel ils effectuent la r\u00e9cup\u00e9ration. Par exemple, la r\u00e9cup\u00e9ration d&#8217;un favicon peut avoir une limite tr\u00e8s basse, contrairement \u00e0 la recherche d&#8217;images.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Pour tout autre crawler ne sp\u00e9cifiant pas de limite, la valeur par d\u00e9faut est de 15 Mo, quel que soit le type de contenu.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Qu&#8217;est-ce que cela signifie pour les octets que votre serveur envoie ?<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n  <li>\n    <strong>R\u00e9cup\u00e9ration partielle :<\/strong> Si votre fichier HTML d\u00e9passe 2 Mo, Googlebot ne rejette pas la page. Il arr\u00eate simplement la r\u00e9cup\u00e9ration exactement \u00e0 la limite de 2 Mo. Notez que cette limite inclut les en-t\u00eates de requ\u00eate HTTP.\n  <\/li>\n  <li>\n    <strong>Traitement de la coupure :<\/strong> Cette portion t\u00e9l\u00e9charg\u00e9e (les 2 premiers Mo) est transmise \u00e0 nos syst\u00e8mes d&#8217;indexation et au Web Rendering Service (WRS) comme s&#8217;il s&#8217;agissait du fichier complet.\n  <\/li>\n  <li>\n    <strong>Les octets invisibles :<\/strong> Tous les octets situ\u00e9s <em>apr\u00e8s<\/em> ce seuil de 2 Mo sont totalement ignor\u00e9s. Ils ne sont ni r\u00e9cup\u00e9r\u00e9s, ni rendus, ni index\u00e9s.\n  <\/li>\n  <li>\n    <strong>Importation des ressources :<\/strong> Chaque ressource r\u00e9f\u00e9renc\u00e9e dans le HTML (hors m\u00e9dias, polices et quelques fichiers exotiques) sera r\u00e9cup\u00e9r\u00e9e par le WRS avec Googlebot, tout comme le HTML parent. Elles poss\u00e8dent leur propre compteur d&#8217;octets par URL et ne sont pas comptabilis\u00e9es dans la taille de la page parente.\n  <\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Pour la grande majorit\u00e9 du web, une charge utile HTML de 2 Mo est \u00e9norme, et vous n&#8217;atteindrez jamais cette limite. Cependant, si votre page inclut des images base64 en ligne lourdes, des blocs massifs de CSS\/JavaScript en ligne, ou commence par des m\u00e9gaoctets de menus, vous pourriez accidentellement repousser votre contenu textuel r\u00e9el ou vos donn\u00e9es structur\u00e9es critiques au-del\u00e0 de la barre des 2 Mo. Si ces octets cruciaux ne sont pas r\u00e9cup\u00e9r\u00e9s, pour Googlebot, ils n&#8217;existent tout simplement pas.\n<\/p>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"rendering-the-bytes\" tabindex=\"-1\">Rendu des octets<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Une fois que le crawler a r\u00e9cup\u00e9r\u00e9 les octets (jusqu&#8217;\u00e0 la limite), il passe le relais au WRS. Le WRS traite le JavaScript et ex\u00e9cute le code c\u00f4t\u00e9 client comme un navigateur moderne pour comprendre l&#8217;\u00e9tat visuel et textuel final de la page. Le rendu r\u00e9cup\u00e8re et ex\u00e9cute les fichiers JavaScript et CSS, et traite les requ\u00eates XHR pour mieux comprendre le contenu textuel et la structure de la page (il ne demande pas d&#8217;images ou de vid\u00e9os). Pour chaque ressource demand\u00e9e, la limite de 2 Mo s&#8217;applique \u00e9galement.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Cependant, rappelez-vous que le WRS ne peut ex\u00e9cuter que le code que le crawler a r\u00e9ellement r\u00e9cup\u00e9r\u00e9. De plus, le\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/fix-javascript-problems\/\" class=\"external-link\">WRS fonctionne sans \u00e9tat<\/a>\n  &mdash; il efface le stockage local et les donn\u00e9es de session entre les requ\u00eates. Cela peut avoir des implications particuli\u00e8res sur la fa\u00e7on dont les \u00e9l\u00e9ments dynamiques d\u00e9pendants du JavaScript sont interpr\u00e9t\u00e9s par nos syst\u00e8mes.\n<\/p>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"best-practices-for-your-bytes\" tabindex=\"-1\">Bonnes pratiques pour vos octets<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Pour garantir que Googlebot puisse r\u00e9cup\u00e9rer et comprendre efficacement votre contenu, gardez \u00e0 l&#8217;esprit ces bonnes pratiques au niveau des octets :\n<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n  <li>\n    <strong>Gardez votre HTML l\u00e9ger :<\/strong> D\u00e9placez les CSS et JavaScript lourds vers des fichiers externes. Bien que le document HTML initial soit limit\u00e9 \u00e0 2 Mo, les scripts et feuilles de style externes sont r\u00e9cup\u00e9r\u00e9s s\u00e9par\u00e9ment (soumis \u00e0 leurs propres limites).\n  <\/li>\n  <li>\n    <strong>L&#8217;ordre compte :<\/strong> Placez vos \u00e9l\u00e9ments les plus critiques &mdash; comme les balises meta, les \u00e9l\u00e9ments <code>&lt;title&gt;<\/code>, les \u00e9l\u00e9ments <code>&lt;link&gt;<\/code>, les canonicals et les donn\u00e9es structur\u00e9es essentielles &mdash; le plus haut possible dans le document HTML. Cela garantit qu&#8217;ils ne se retrouveront pas apr\u00e8s la coupure.\n  <\/li>\n  <li>\n    <strong>Surveillez vos logs de serveur :<\/strong> Gardez un \u0153il sur les temps de r\u00e9ponse de votre serveur. Si votre serveur peine \u00e0 servir les octets, nos crawlers ralentiront automatiquement pour \u00e9viter de surcharger votre infrastructure, ce qui r\u00e9duira votre fr\u00e9quence de crawl.\n  <\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">\n  <strong>Notez que cette limite n&#8217;est pas grav\u00e9e dans le marbre<\/strong> et peut \u00e9voluer avec le temps \u00e0 mesure que le web progresse et que les pages HTML augmentent en taille. (Ou diminuent. Esp\u00e9rons qu&#8217;elles diminuent.)\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  Le crawl n&#8217;est pas de la magie ; c&#8217;est un \u00e9change d&#8217;octets hautement orchestr\u00e9 et mis \u00e0 l&#8217;\u00e9chelle. En comprenant comment notre infrastructure de r\u00e9cup\u00e9ration centrale r\u00e9cup\u00e8re et limite ces octets, vous pouvez vous assurer que le contenu le plus important de votre site est toujours pris en compte.\n<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bonne optimisation !<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">\n  <em>Vous voulez plus de d\u00e9tails sur les coulisses ? Consultez l&#8217;\n    <a href=\"https:\/\/www.youtube.com\/watch?v=JpweMBnpS4Q\" class=\"external-link\">\u00e9pisode 105 du podcast Search Off the Record sur YouTube<\/a>\n    ou sur votre plateforme de podcast pr\u00e9f\u00e9r\u00e9e !<\/em>\n<\/p>\n\n\n\n<p class=\"byline-author wp-block-paragraph\">\n  Publi\u00e9 par\n  <a href=\"https:\/\/developers.google.com\/search\/blog\/authors\/gary-illyes\">Gary<\/a>.\n<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Mardi 31 mars 2026 Si vous avez \u00e9cout\u00e9 l&#8217; \u00e9pisode 105 du podcast Search Off the Record, vous nous avez peut-\u00eatre entendus aborder en profondeur un sujet qui nous tient \u00e0 c\u0153ur (et qui occupe nos serveurs) : le fonctionnement interne de Googlebot. Pendant longtemps, le nom &#8220;Googlebot&#8221; a \u00e9voqu\u00e9 l&#8217;image d&#8217;un robot unique et [&hellip;]<\/p>\n","protected":false},"menu_order":79457,"template":"","meta":{"footnotes":""},"ar_kb_kategori":[665],"ar_kb_etiket":[],"class_list":["post-25374","ar_kb","type-ar_kb","status-publish","has-post-thumbnail","hentry","ar_kb_kategori-blog"],"_links":{"self":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb\/25374","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb"}],"about":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/types\/ar_kb"}],"version-history":[{"count":0,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb\/25374\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/media\/27494"}],"wp:attachment":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/media?parent=25374"}],"wp:term":[{"taxonomy":"ar_kb_kategori","embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb_kategori?post=25374"},{"taxonomy":"ar_kb_etiket","embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb_etiket?post=25374"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}