Crawl-delay ha sido ignorado por Yandex desde el 22 de febrero de 2018. Cualquier sitio que aún mantenga esta directiva contiene una línea que no realiza ninguna función.
Qué lo reemplazó
La configuración de tasa de rastreo (crawl rate) en Yandex Webmaster, bajo Indexing → Crawl rate. Por defecto es automática, calculada para cargar tantas páginas como sea posible sin sobrecargar el servidor, y puede configurarse manualmente por sitio — incluso de forma independiente para cada subdominio.
Por qué el cambio es una mejora
Una directiva de archivo es estática y ciega: aplica el mismo retraso tanto si el servidor está inactivo como si está saturado, y ralentiza al robot incluso cuando hay capacidad de sobra. La configuración de la consola es una recomendación que Yandex pondera frente a lo que sabe sobre el sitio, y el modo automático se adapta.
Antes de recurrir a ello
Aquí se aplica la guía de Yandex sobre la tasa de rastreo: averigüe qué está solicitando realmente el robot antes de ralentizarlo. Si la carga proviene de combinaciones de filtros, URLs de sesión y resultados de búsqueda interna —como suele ocurrir—, el remedio correcto es Disallow o Clean-param, lo cual elimina las solicitudes innecesarias y devuelve el presupuesto de rastreo a las páginas reales. Reducir la tasa mantiene el desperdicio y ralentiza todo lo demás junto con él.
Mantenimiento
Elimine Crawl-delay de su robots.txt la próxima vez que lo edite. No tiene efecto en Yandex, otros rastreadores aún lo respetan, y dejarlo ahí sugiere que existe un control de tasa donde no lo hay —que es exactamente el tipo de suposición que sobrevive a la persona que escribió el archivo.
Dónde sigue existiendo un límite real
Si el tráfico de robots es un problema operativo real, la configuración de la consola es el único control frente a Yandex, y debe configurarse para el dominio principal y cada subdominio por separado. Una tasa establecida en el dominio principal no afecta al subdominio que realmente está bajo carga.
Cómo lo aplicamos
We remove stale Crawl-delay lines when auditing, because their presence convinces teams that crawl rate is under control when it is not. The per-subdomain requirement is the detail that catches people: the load is usually on one subdomain, and the setting applied to the main domain has no effect there at all.
Servicios relacionados