Googlebot — это общее название двух типов веб-краулеров, используемых в Google Search:
- Googlebot Smartphone: мобильный краулер, имитирующий действия пользователя на мобильном устройстве.
- Googlebot Desktop: десктопный краулер, имитирующий действия пользователя на компьютере.
Вы можете определить подтип Googlebot, проверив заголовок HTTP-запроса user-agent. Однако оба типа краулеров используют один и тот же токен продукта (user agent token) в файле robots.txt, поэтому вы не можете выборочно ограничить доступ для Googlebot Smartphone или Googlebot Desktop через robots.txt.
Для большинства сайтов Google Search в первую очередь индексирует мобильную версию контента. Соответственно, большинство запросов на сканирование от Googlebot будет поступать от мобильного краулера, и лишь меньшая часть — от десктопного.
Как Googlebot получает доступ к вашему сайту
Для большинства сайтов Googlebot в среднем не должен обращаться к ресурсу чаще, чем раз в несколько секунд. Однако из-за задержек скорость может казаться немного выше в течение коротких промежутков времени. Если ваш сайт не справляется с запросами на сканирование от Google, вы можете снизить скорость сканирования.
При сканировании для Google Search, Googlebot считывает первые 2 МБ поддерживаемого типа файла и первые 64 МБ PDF-файла. С точки зрения рендеринга, каждый ресурс, на который есть ссылка в HTML (например, CSS и JavaScript), загружается отдельно, и на каждый такой запрос распространяется то же ограничение по размеру файла, что и на другие файлы (за исключением PDF).
Как только лимит достигнут, Googlebot прекращает загрузку и отправляет на индексацию только ту часть файла, которая была получена. Ограничение размера файла применяется к несжатым данным. Другие краулеры Google, например Googlebot Video и Googlebot Image, могут иметь другие лимиты.
При сканировании с IP-адресов в США часовой пояс Googlebot — тихоокеанское время (Pacific Time).
Другие технические характеристики Googlebot описаны в обзоре краулеров Google.
Блокировка доступа Googlebot к вашему сайту
Googlebot находит новые URL для сканирования преимущественно по ссылкам, размещенным на ранее просканированных страницах. Сделать сайт «секретным», просто не публикуя на него ссылки, практически невозможно. Например, как только кто-то перейдет по ссылке с вашего «секретного» сайта на другой ресурс, URL вашего сайта может появиться в теге referrer, быть сохранен и опубликован другим сайтом в его логах переходов.
Если вы хотите запретить Googlebot сканировать контент на вашем сайте, у вас есть несколько вариантов. Помните, что существует разница между сканированием и индексацией; блокировка сканирования страницы для Googlebot не гарантирует, что URL страницы не появится в результатах поиска:
- Запретить Googlebot сканировать страницу? Используйте файл robots.txt.
- Не хотите, чтобы Google индексировал страницу? Используйте
noindex. - Полностью ограничить доступ к странице для краулеров и пользователей? Используйте другой метод, например, защиту паролем.
Блокировка Googlebot влияет на Google Search (включая Discover и все функции поиска Google), а также на другие продукты, такие как Google Картинки, Google Видео и Google Новости.
Верификация Googlebot
Прежде чем блокировать Googlebot, учтите, что заголовок HTTP-запроса user-agent, используемый Googlebot, часто подделывается другими краулерами. Важно убедиться, что подозрительный запрос действительно исходит от Google. Лучший способ подтвердить, что запрос отправлен Googlebot — это выполнить обратный DNS-поиск по исходному IP-адресу запроса или сопоставить IP-адрес с диапазонами IP-адресов Googlebot.
Как мы это применяем
Knowing exactly which Googlebot variant hit a URL is what makes log analysis useful. We segment logs by user agent so mobile crawl coverage can be measured separately from desktop.
Связанные услуги