{"id":25334,"date":"2024-12-03T00:00:00","date_gmt":"2024-12-03T00:00:00","guid":{"rendered":"https:\/\/alienroad.com\/google-bilgi-bankasi\/crawling-december-the-how-and-why-of-googlebot-crawling\/"},"modified":"2024-12-03T00:00:00","modified_gmt":"2024-12-03T00:00:00","slug":"crawling-december-the-how-and-why-of-googlebot-crawling","status":"publish","type":"ar_kb","link":"https:\/\/alienroad.com\/google-bilgi-bankasi\/crawling-december-the-how-and-why-of-googlebot-crawling\/","title":{"rendered":"Diciembre de rastreo: El c\u00f3mo y el porqu\u00e9 del rastreo de Googlebot"},"content":{"rendered":"<p class=\"gargardate\">Martes, 3 de diciembre de 2024<\/p>\n<p>\n  Es posible que hayas o\u00eddo que la B\u00fasqueda de Google necesita realizar cierto trabajo antes de que una p\u00e1gina web pueda aparecer en los resultados de la B\u00fasqueda de Google. Uno de estos pasos se denomina rastreo. El rastreo para la B\u00fasqueda de Google lo realiza Googlebot, un programa que se ejecuta en los servidores de Google, el cual recupera una URL y gestiona aspectos como errores de red, redirecciones y otras peque\u00f1as complicaciones que pueda encontrar mientras recorre la web. Sin embargo, hay algunos detalles de los que no se suele hablar. Cada semana de este mes exploraremos algunos de esos detalles, ya que pueden tener un efecto significativo en c\u00f3mo se rastrean tus sitios.\n<\/p>\n<h2 id=\"backing-up-a-little:-what-is-crawling\" tabindex=\"-1\">Retrocedamos un poco: \u00bfQu\u00e9 es el rastreo?<\/h2>\n<p>\n  El <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/how-search-works\/#crawling\">rastreo<\/a> es el proceso de descubrir p\u00e1ginas web nuevas, volver a visitar las actualizadas y descargarlas. En resumen, Googlebot obtiene una URL, realiza una solicitud HTTP al servidor que la aloja y luego gestiona la respuesta de dicho servidor, posiblemente siguiendo redirecciones, manejando errores y enviando el contenido de la p\u00e1gina al sistema de indexaci\u00f3n de Google.\n<\/p>\n<p>\n  Pero las p\u00e1ginas web modernas no son solo HTML puro, as\u00ed que \u00bfqu\u00e9 pasa con los otros recursos que componen una p\u00e1gina? \u00bfC\u00f3mo afecta el rastreo de estos recursos al &#8220;presupuesto de rastreo&#8221;? \u00bfSon estos recursos almacenables en cach\u00e9 por parte de Google? \u00bfY existe alguna diferencia entre las URLs que no se han rastreado antes y las que ya est\u00e1n indexadas? \u00a1En este art\u00edculo vamos a responder a estas preguntas y m\u00e1s!\n<\/p>\n<h2 id=\"googlebot-and-crawling-page-resources\" tabindex=\"-1\">Googlebot y el rastreo de recursos de p\u00e1gina<\/h2>\n<p>\n  M\u00e1s all\u00e1 del HTML, los sitios web modernos utilizan una combinaci\u00f3n de diferentes tecnolog\u00edas, como JavaScript y CSS, para ofrecer a los usuarios experiencias din\u00e1micas y funcionalidades \u00fatiles. Al acceder a dichas p\u00e1ginas con un navegador, este primero descarga la URL principal que aloja los datos necesarios para empezar a construir la p\u00e1gina para el usuario: el HTML de la p\u00e1gina. Estos datos iniciales pueden contener referencias a recursos como JavaScript y CSS, pero tambi\u00e9n im\u00e1genes y v\u00eddeos que el navegador descargar\u00e1 posteriormente para construir finalmente la p\u00e1gina que se presenta al usuario.\n<\/p>\n<p>\n  <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/javascript-seo-basics\/\">Google hace exactamente lo mismo<\/a>, aunque de forma ligeramente diferente:\n<\/p>\n<ol>\n<li>Googlebot descarga los datos iniciales de la URL principal: el HTML de la p\u00e1gina.<\/li>\n<li>Googlebot env\u00eda los datos obtenidos al Servicio de Renderizado Web (WRS).<\/li>\n<li>Utilizando Googlebot, el WRS descarga los recursos referenciados en los datos originales.<\/li>\n<li>El WRS construye la p\u00e1gina utilizando todos los recursos descargados, tal como lo har\u00eda el navegador de un usuario.<\/li>\n<\/ol>\n<p>\n  En comparaci\u00f3n con un navegador, el tiempo entre cada paso puede ser significativamente mayor debido a restricciones de programaci\u00f3n, como la carga percibida del servidor que aloja los recursos necesarios para renderizar una p\u00e1gina. Y aqu\u00ed es donde el <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/troubleshoot-google-search-crawling-errors\/#general_theory\">presupuesto de rastreo<\/a> entra en la conversaci\u00f3n.\n<\/p>\n<p>\n  Rastrear los recursos necesarios para renderizar una p\u00e1gina consumir\u00e1 parte del presupuesto de rastreo del nombre de host que aloja el recurso. Para mejorar esto, el WRS intenta almacenar en cach\u00e9 cada recurso (JavaScript y CSS) referenciado en las p\u00e1ginas que renderiza. El tiempo de vida (TTL) de la cach\u00e9 del WRS no se ve afectado por las directivas de cach\u00e9 HTTP; en su lugar, el WRS almacena todo durante un m\u00e1ximo de 30 d\u00edas, lo que ayuda a preservar el presupuesto de rastreo del sitio para otras tareas de rastreo.\n<\/p>\n<p>\n  Desde la perspectiva de los propietarios de sitios, gestionar c\u00f3mo y qu\u00e9 recursos se rastrean puede influir en el presupuesto de rastreo del sitio; recomendamos:\n<\/p>\n<ol>\n<li>\n    <strong>Utilizar la menor cantidad de recursos posible<\/strong> para ofrecer a los usuarios una gran experiencia; cuantos menos recursos se necesiten para renderizar una p\u00e1gina, menos presupuesto de rastreo se gastar\u00e1 durante el renderizado.\n  <\/li>\n<li>\n    <strong>Utilizar par\u00e1metros de control de cach\u00e9 con precauci\u00f3n<\/strong>: si las URLs de los recursos cambian, es posible que Google necesite rastrear los recursos de nuevo, incluso si su contenido no ha cambiado. Esto, por supuesto, consumir\u00e1 presupuesto de rastreo.\n  <\/li>\n<li>\n    <strong>Alojar los recursos en un nombre de host diferente<\/strong> al del sitio principal, por ejemplo, empleando una CDN o simplemente alojando los recursos en un subdominio distinto. Esto trasladar\u00e1 las preocupaciones sobre el presupuesto de rastreo al host que sirve los recursos.<\/p>\n<aside class=\"note\"><strong>Actualizaci\u00f3n del 6 de diciembre de 2024:<\/strong> Esto puede resultar en un rendimiento de p\u00e1gina m\u00e1s lento debido a la sobrecarga de conexi\u00f3n a un nombre de host diferente, por lo que <a href=\"https:\/\/web.dev\/articles\/optimize-lcp#different-origin\" class=\"external-link\">no recomendamos esta estrategia para recursos cr\u00edticos<\/a> (como JavaScript o CSS) que son necesarios para renderizar una p\u00e1gina. Sin embargo, para recursos m\u00e1s grandes no cr\u00edticos, como v\u00eddeos o descargas, vale la pena considerar este enfoque.<\/aside>\n<\/li>\n<\/ol>\n<p>\n  Todos estos puntos se aplican tambi\u00e9n a los recursos multimedia. Si Googlebot (o m\u00e1s espec\u00edficamente, <code>Googlebot-Image<\/code> y <code>Googlebot-Video<\/code>, respectivamente) los obtiene, consumir\u00e1 el presupuesto de rastreo del sitio.\n<\/p>\n<p>\n  Es tentador a\u00f1adir tambi\u00e9n <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/robots-txt-intro\/\">robots.txt<\/a> a la lista; sin embargo, desde una perspectiva de renderizado, impedir el rastreo de recursos suele causar problemas. Si el WRS no puede obtener un recurso cr\u00edtico para el renderizado, la B\u00fasqueda de Google puede tener dificultades para extraer el contenido de la p\u00e1gina y permitir que esta se posicione en la B\u00fasqueda.\n<\/p>\n<h2 id=\"what-is-googlebot-crawling\" tabindex=\"-1\">\u00bfQu\u00e9 est\u00e1 rastreando Googlebot?<\/h2>\n<p>\n  La mejor fuente para analizar qu\u00e9 recursos est\u00e1 rastreando Google son los registros de acceso sin procesar (raw access logs) del sitio, que contienen una entrada para cada URL solicitada tanto por navegadores como por rastreadores. Para identificar a los rastreadores de Google en el registro de acceso, publicamos nuestros <a href=\"https:\/\/alienroad.com\/google-bilgi-bankasi\/google-crawlers\/\">rangos de IP en nuestra documentaci\u00f3n para desarrolladores<\/a>.\n<\/p>\n<p>\n  El segundo mejor recurso es, por supuesto, el <a href=\"https:\/\/support.google.com\/webmasters\/answer\/9679690\" class=\"external-link\">informe de Estad\u00edsticas de rastreo de Search Console<\/a>, que desglosa cada tipo de recurso por rastreador:\n<\/p>\n<p><img decoding=\"async\" src=\"https:\/\/alienroad.com\/wp-content\/uploads\/kb-gorsel\/g-a6f6a676fb47.png\" loading=\"lazy\" alt=\"El informe de Estad\u00edsticas de rastreo en Search Console que muestra los diferentes tipos de recursos rastreados por Googlebot\" \/><\/p>\n<p>\n  Finalmente, si realmente te interesa el rastreo y el renderizado y quieres hablar de ello con otros, la <a href=\"https:\/\/goo.gle\/sc-forum\" class=\"external-link\">comunidad de Search Central<\/a> es el lugar ideal, pero tambi\u00e9n puedes encontrarnos en <a href=\"https:\/\/www.linkedin.com\/showcase\/googlesearchcentral\/\" class=\"external-link\">LinkedIn<\/a>.\n<\/p>\n<p class=\"byline-author\">\n  Publicado por<br \/>\n  <a href=\"https:\/\/developers.google.com\/search\/blog\/authors\/martin-splitt\">Martin Splitt<\/a> y<br \/>\n  <a href=\"https:\/\/developers.google.com\/search\/blog\/authors\/gary-illyes\">Gary Illyes<\/a>\n<\/p>\n<hr>\n<h2 id=\"updates\" tabindex=\"-1\">\n    Actualizaciones<br \/>\n<\/h2>\n<ul>\n<li><b>Actualizaci\u00f3n del 6 de diciembre de 2024<\/b>: Se se\u00f1al\u00f3 el impacto en el rendimiento de servir recursos desde un origen diferente.<\/li>\n<\/ul>\n<hr class=\"full-width\">\n<h2 id=\"want-to-learn-more-about-crawling-check-out-the-entire-crawling-december-series:\" tabindex=\"-1\">\u00bfQuieres aprender m\u00e1s sobre el rastreo? Echa un vistazo a toda la serie Crawling December:<\/h2>\n","protected":false},"excerpt":{"rendered":"<p>Martes, 3 de diciembre de 2024 Es posible que hayas o\u00eddo que la B\u00fasqueda de Google necesita realizar cierto trabajo antes de que una p\u00e1gina web pueda aparecer en los resultados de la B\u00fasqueda de Google. Uno de estos pasos se denomina rastreo. El rastreo para la B\u00fasqueda de Google lo realiza Googlebot, un programa [&hellip;]<\/p>\n","protected":false},"menu_order":79940,"template":"","meta":{"footnotes":""},"ar_kb_kategori":[665],"ar_kb_etiket":[],"class_list":["post-25334","ar_kb","type-ar_kb","status-publish","has-post-thumbnail","hentry","ar_kb_kategori-blog"],"_links":{"self":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb\/25334","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb"}],"about":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/types\/ar_kb"}],"version-history":[{"count":0,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb\/25334\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/media\/27454"}],"wp:attachment":[{"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/media?parent=25334"}],"wp:term":[{"taxonomy":"ar_kb_kategori","embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb_kategori?post=25334"},{"taxonomy":"ar_kb_etiket","embeddable":true,"href":"https:\/\/alienroad.com\/wp-json\/wp\/v2\/ar_kb_etiket?post=25334"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}