Puedes controlar a qué archivos pueden acceder los rastreadores en tu sitio mediante un archivo robots.txt.
Un archivo robots.txt se aloja en la raíz de tu sitio. Por lo tanto, para el sitio www.example.com, el archivo robots.txt se encuentra en www.example.com/robots.txt. robots.txt es un archivo de texto plano que sigue el Estándar de exclusión de robots. Un archivo robots.txt consta de una o más reglas. Cada regla bloquea o permite el acceso de todos los rastreadores, o de uno específico, a una ruta de archivo determinada en el dominio o subdominio donde está alojado el archivo robots.txt. A menos que especifiques lo contrario en tu archivo robots.txt, todos los archivos están implícitamente permitidos para el rastreo.
Aquí tienes un archivo robots.txt sencillo con dos reglas:
Esto es lo que significa ese archivo robots.txt:
- Al agente de usuario llamado Googlebot no se le permite rastrear ninguna URL que comience con
https://example.com/nogooglebot/. - A todos los demás agentes de usuario se les permite rastrear todo el sitio. Esto podría haberse omitido y el resultado habría sido el mismo; el comportamiento predeterminado es que los agentes de usuario pueden rastrear todo el sitio.
- El archivo sitemap del sitio se encuentra en
https://www.example.com/sitemap.xml.
Consulta la sección de sintaxis para ver más ejemplos.
Directrices básicas para crear un archivo robots.txt
Crear un archivo robots.txt y hacerlo accesible y útil implica cuatro pasos:
- Crea un archivo llamado robots.txt.
- Añade reglas al archivo robots.txt.
- Sube el archivo robots.txt a la raíz de tu sitio.
- Prueba el archivo robots.txt.
Crear un archivo robots.txt
Puedes usar casi cualquier editor de texto para crear un archivo robots.txt. Por ejemplo, el Bloc de notas, TextEdit, vi y emacs pueden crear archivos robots.txt válidos. No utilices un procesador de textos; estos suelen guardar los archivos en un formato propietario y pueden añadir caracteres inesperados, como comillas tipográficas, que pueden causar problemas a los rastreadores. Asegúrate de guardar el archivo con codificación UTF-8 si se te solicita durante el diálogo de guardado.
Reglas de formato y ubicación:
- El archivo debe llamarse robots.txt.
- Tu sitio solo puede tener un archivo robots.txt.
- El archivo robots.txt debe estar ubicado en la raíz del host del sitio al que se aplica. Por ejemplo, para controlar el rastreo en todas las URL bajo
https://www.example.com/, el archivo robots.txt debe estar enhttps://www.example.com/robots.txt. No puede colocarse en un subdirectorio (por ejemplo, enhttps://example.com/pages/robots.txt). Si no estás seguro de cómo acceder a la raíz de tu sitio o necesitas permisos para hacerlo, contacta con tu proveedor de servicios de alojamiento web. Si no puedes acceder a la raíz de tu sitio, utiliza un método de bloqueo alternativo, como las etiquetasmeta. - Un archivo robots.txt puede publicarse en un subdominio (por ejemplo,
https://site.example.com/robots.txt) o en puertos no estándar (por ejemplo,https://example.com:8181/robots.txt). - Un archivo robots.txt se aplica solo a las rutas dentro del protocolo, host y puerto donde se publica. Es decir, las reglas en
https://example.com/robots.txtse aplican solo a los archivos enhttps://example.com/, no a subdominios comohttps://m.example.com/, ni a protocolos alternativos, comohttp://example.com/. - Un archivo robots.txt debe ser un archivo de texto codificado en UTF-8 (lo que incluye ASCII). Google puede ignorar caracteres que no formen parte del rango UTF-8, lo que podría invalidar las reglas del robots.txt.
Cómo escribir reglas en robots.txt
Las reglas son instrucciones para los rastreadores sobre qué partes de tu sitio pueden rastrear. Sigue estas directrices al añadir reglas a tu archivo robots.txt:
- Un archivo robots.txt consta de uno o más grupos (conjuntos de reglas).
- Cada grupo consta de varias reglas (también conocidas como directivas), una regla por línea. Cada grupo comienza con una línea
User-agentque especifica el objetivo de los grupos. - Un grupo proporciona la siguiente información:
- A quién se aplica el grupo (el agente de usuario).
- Qué directorios o archivos puede acceder ese agente.
- Qué directorios o archivos no puede acceder ese agente.
- Los rastreadores procesan los grupos de arriba a abajo. Un agente de usuario solo puede coincidir con un conjunto de reglas, que es el primer grupo más específico que coincide con un agente de usuario determinado. Si hay varios grupos para el mismo agente de usuario, los grupos se combinarán en uno solo antes de procesarse.
- La suposición predeterminada es que un agente de usuario puede rastrear cualquier página o directorio que no esté bloqueado por una regla
disallow. - Las reglas distinguen entre mayúsculas y minúsculas. Por ejemplo,
disallow: /file.aspse aplica ahttps://www.example.com/file.asp, pero no ahttps://www.example.com/FILE.asp. - El carácter
#marca el inicio de un comentario. Los comentarios se ignoran durante el procesamiento.
Los rastreadores de Google admiten las siguientes reglas en los archivos robots.txt:
user-agent:[Obligatorio, uno o más por grupo] La regla especifica el nombre del cliente automático conocido como rastreador de motor de búsqueda al que se aplica la regla. Esta es la primera línea de cualquier grupo de reglas. Los nombres de los agentes de usuario de Google se enumeran en la lista de agentes de usuario de Google. El uso de un asterisco (*) coincide con todos los rastreadores, excepto con los diversos rastreadores AdsBot, que deben nombrarse explícitamente. Por ejemplo:disallow:[Al menos una o más entradasdisallowoallowpor regla] Un directorio o página, relativo al dominio raíz, que no quieres que el agente de usuario rastree. Si la regla se refiere a una página, debe ser el nombre completo de la página tal como se muestra en el navegador. Debe comenzar con un carácter/y, si se refiere a un directorio, debe terminar con la marca/.allow:[Al menos una o más entradasdisallowoallowpor regla] Un directorio o página, relativo al dominio raíz, que puede ser rastreado por el agente de usuario mencionado anteriormente. Se utiliza para anular una regladisallowy permitir el rastreo de un subdirectorio o página dentro de un directorio no permitido. Para una sola página, especifica el nombre completo de la página tal como se muestra en el navegador. Debe comenzar con un carácter/y, si se refiere a un directorio, debe terminar con la marca/.sitemap:[Opcional, cero o más por archivo] La ubicación de un sitemap para este sitio. La URL del sitemap debe ser una URL completa; Google no asume ni comprueba alternativas http/https/www.non-www. Los sitemaps son una buena forma de indicar qué contenido debe rastrear Google, a diferencia de qué contenido puede o no puede rastrear. Más información sobre sitemaps. Ejemplo:
Todas las reglas, excepto sitemap, admiten el comodín * para un prefijo de ruta, sufijo o cadena completa.
Las líneas que no coinciden con ninguna de estas reglas se ignoran.
Lee nuestra página sobre la interpretación de Google de la especificación robots.txt para obtener la descripción completa de cada regla.
Subir el archivo robots.txt
Una vez que hayas guardado tu archivo robots.txt en tu ordenador, estarás listo para ponerlo a disposición de los rastreadores de los motores de búsqueda. No existe una única herramienta que pueda ayudarte con esto, ya que la forma en que subes el archivo robots.txt a tu sitio depende de la arquitectura de tu sitio y servidor. Ponte en contacto con tu empresa de alojamiento o busca en su documentación; por ejemplo, busca “subir archivos infomaniak”.
Después de subir el archivo robots.txt, comprueba si es accesible públicamente y si Google puede analizarlo.
Probar el marcado de robots.txt
Para probar si tu archivo robots.txt recién subido es accesible públicamente, abre una ventana de navegación privada (o equivalente) en tu navegador y navega a la ubicación del archivo robots.txt. Por ejemplo, https://example.com/robots.txt. Si ves el contenido de tu archivo robots.txt, estás listo para probar el marcado.
Google ofrece dos opciones para solucionar problemas con el marcado de robots.txt:
- El informe de robots.txt en Search Console. Solo puedes usar este informe para archivos robots.txt que ya sean accesibles en tu sitio.
- Si eres desarrollador, consulta y compila la biblioteca de código abierto de robots.txt de Google, que también se utiliza en la Búsqueda de Google. Puedes usar esta herramienta para probar archivos robots.txt localmente en tu ordenador.
Enviar el archivo robots.txt a Google
Una vez que hayas subido y probado tu archivo robots.txt, los rastreadores de Google encontrarán y comenzarán a utilizar tu archivo robots.txt automáticamente. No tienes que hacer nada. Si has actualizado tu archivo robots.txt y necesitas actualizar la copia en caché de Google lo antes posible, aprende cómo enviar un archivo robots.txt actualizado.
Cómo lo aplicamos
Most robots.txt files we inherit contain rules nobody can explain. We rewrite them from scratch against this guidance and document each line, so the next team knows what it is safe to change.
Servicios relacionados