Martes, 3 de diciembre de 2024
Es posible que hayas oído que la Búsqueda de Google necesita realizar cierto trabajo antes de que una página web pueda aparecer en los resultados de la Búsqueda de Google. Uno de estos pasos se denomina rastreo. El rastreo para la Búsqueda de Google lo realiza Googlebot, un programa que se ejecuta en los servidores de Google, el cual recupera una URL y gestiona aspectos como errores de red, redirecciones y otras pequeñas complicaciones que pueda encontrar mientras recorre la web. Sin embargo, hay algunos detalles de los que no se suele hablar. Cada semana de este mes exploraremos algunos de esos detalles, ya que pueden tener un efecto significativo en cómo se rastrean tus sitios.
Retrocedamos un poco: ¿Qué es el rastreo?
El rastreo es el proceso de descubrir páginas web nuevas, volver a visitar las actualizadas y descargarlas. En resumen, Googlebot obtiene una URL, realiza una solicitud HTTP al servidor que la aloja y luego gestiona la respuesta de dicho servidor, posiblemente siguiendo redirecciones, manejando errores y enviando el contenido de la página al sistema de indexación de Google.
Pero las páginas web modernas no son solo HTML puro, así que ¿qué pasa con los otros recursos que componen una página? ¿Cómo afecta el rastreo de estos recursos al “presupuesto de rastreo”? ¿Son estos recursos almacenables en caché por parte de Google? ¿Y existe alguna diferencia entre las URLs que no se han rastreado antes y las que ya están indexadas? ¡En este artículo vamos a responder a estas preguntas y más!
Googlebot y el rastreo de recursos de página
Más allá del HTML, los sitios web modernos utilizan una combinación de diferentes tecnologías, como JavaScript y CSS, para ofrecer a los usuarios experiencias dinámicas y funcionalidades útiles. Al acceder a dichas páginas con un navegador, este primero descarga la URL principal que aloja los datos necesarios para empezar a construir la página para el usuario: el HTML de la página. Estos datos iniciales pueden contener referencias a recursos como JavaScript y CSS, pero también imágenes y vídeos que el navegador descargará posteriormente para construir finalmente la página que se presenta al usuario.
Google hace exactamente lo mismo, aunque de forma ligeramente diferente:
- Googlebot descarga los datos iniciales de la URL principal: el HTML de la página.
- Googlebot envía los datos obtenidos al Servicio de Renderizado Web (WRS).
- Utilizando Googlebot, el WRS descarga los recursos referenciados en los datos originales.
- El WRS construye la página utilizando todos los recursos descargados, tal como lo haría el navegador de un usuario.
En comparación con un navegador, el tiempo entre cada paso puede ser significativamente mayor debido a restricciones de programación, como la carga percibida del servidor que aloja los recursos necesarios para renderizar una página. Y aquí es donde el presupuesto de rastreo entra en la conversación.
Rastrear los recursos necesarios para renderizar una página consumirá parte del presupuesto de rastreo del nombre de host que aloja el recurso. Para mejorar esto, el WRS intenta almacenar en caché cada recurso (JavaScript y CSS) referenciado en las páginas que renderiza. El tiempo de vida (TTL) de la caché del WRS no se ve afectado por las directivas de caché HTTP; en su lugar, el WRS almacena todo durante un máximo de 30 días, lo que ayuda a preservar el presupuesto de rastreo del sitio para otras tareas de rastreo.
Desde la perspectiva de los propietarios de sitios, gestionar cómo y qué recursos se rastrean puede influir en el presupuesto de rastreo del sitio; recomendamos:
- Utilizar la menor cantidad de recursos posible para ofrecer a los usuarios una gran experiencia; cuantos menos recursos se necesiten para renderizar una página, menos presupuesto de rastreo se gastará durante el renderizado.
- Utilizar parámetros de control de caché con precaución: si las URLs de los recursos cambian, es posible que Google necesite rastrear los recursos de nuevo, incluso si su contenido no ha cambiado. Esto, por supuesto, consumirá presupuesto de rastreo.
- Alojar los recursos en un nombre de host diferente al del sitio principal, por ejemplo, empleando una CDN o simplemente alojando los recursos en un subdominio distinto. Esto trasladará las preocupaciones sobre el presupuesto de rastreo al host que sirve los recursos.
Todos estos puntos se aplican también a los recursos multimedia. Si Googlebot (o más específicamente, Googlebot-Image y Googlebot-Video, respectivamente) los obtiene, consumirá el presupuesto de rastreo del sitio.
Es tentador añadir también robots.txt a la lista; sin embargo, desde una perspectiva de renderizado, impedir el rastreo de recursos suele causar problemas. Si el WRS no puede obtener un recurso crítico para el renderizado, la Búsqueda de Google puede tener dificultades para extraer el contenido de la página y permitir que esta se posicione en la Búsqueda.
¿Qué está rastreando Googlebot?
La mejor fuente para analizar qué recursos está rastreando Google son los registros de acceso sin procesar (raw access logs) del sitio, que contienen una entrada para cada URL solicitada tanto por navegadores como por rastreadores. Para identificar a los rastreadores de Google en el registro de acceso, publicamos nuestros rangos de IP en nuestra documentación para desarrolladores.
El segundo mejor recurso es, por supuesto, el informe de Estadísticas de rastreo de Search Console, que desglosa cada tipo de recurso por rastreador:

Finalmente, si realmente te interesa el rastreo y el renderizado y quieres hablar de ello con otros, la comunidad de Search Central es el lugar ideal, pero también puedes encontrarnos en LinkedIn.
Actualizaciones
- Actualización del 6 de diciembre de 2024: Se señaló el impacto en el rendimiento de servir recursos desde un origen diferente.
¿Quieres aprender más sobre el rastreo? Echa un vistazo a toda la serie Crawling December:
Cómo lo aplicamos
Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.
Servicios relacionados