Blog

Обновление Robots: детализация на уровне страниц

Пятница, 14 марта 2025 г.

С помощью файла robots.txt владельцы сайтов
получают простой инструмент для управления доступом поисковых роботов к разделам веб-ресурса.
Чтобы помочь владельцам сайтов точнее определять, как поисковые системы и веб-краулеры могут использовать их страницы, сообщество разработчиков веб-стандартов
предложило использовать robots meta-теги в 1996 году,
всего через несколько месяцев после появления meta-тегов в HTML (и, по иронии судьбы, еще до основания Google). Позже были добавлены
HTTP-заголовки ответа X-Robots-Tag.
Эти инструкции передаются вместе с URL, поэтому роботы могут учитывать их только в том случае, если им не запрещено сканирование данного URL через файл robots.txt. Вместе они образуют протокол исключения для роботов (Robots Exclusion Protocol, REP).

Обзор robots meta-тегов

Meta-теги (или элементы) — это способ добавления машиночитаемых метаданных.
Robots meta-теги являются одним из «видов» meta-тегов и применяются к краулерам, включая поисковых роботов. Они сигнализируют: заблокирован ли контент от индексации? Нужно ли переходить по ссылкам на странице для их сканирования? Эту информацию легко передать непосредственно на странице с помощью robots meta-тегов.

Протокол исключения для роботов для любого URL

Чтобы обеспечить такой же уровень контроля для не-HTML контента, был создан HTTP-заголовок ответа X-Robots-Tag. Эти
HTTP-заголовки
также считаются частью REP.
Заголовок поддерживает те же значения, что и robots meta-тег, и может быть добавлен к любому контенту, размещенному в сети.
Помимо HTML, Google поддерживает его для таких форматов, как PDF, документы и даже изображения.
Большинство этих форматов файлов не имеют механизма, эквивалентного meta-тегам, поэтому HTTP-заголовок ответа здесь очень полезен.

Начало работы с robots meta-тегами и заголовками

Синтаксис прост и расширяем. Правила обычно внедряются веб-разработчиком или через систему управления контентом (CMS), где владельцы сайтов могут выбирать настройки с помощью флажков или выпадающих меню.
Эти элементы управления могут быть направлены на конкретного краулера, например Googlebot, или, если не указывать конкретное имя, на всех роботов, поддерживающих данные значения.

Например, следующие правила запрещают всем краулерам использовать соответствующую страницу для индексации:

  • В виде HTML meta-тега на веб-странице:

    Проверка существующих meta-тегов или заголовков ответа требует чуть больше усилий и прямого анализа содержимого страницы или заголовков.
    Вы можете просмотреть HTML meta-теги на любой странице, открыв исходный код в браузере или используя инструменты разработчика Chrome для
    инспекции страницы.

  • В виде HTTP-заголовка ответа:

    Вы можете проверить HTTP-заголовки ответа для отдельных URL с помощью инструментов разработчика Chrome на
    панели Network.

Другие примеры того, что можно сделать:

Не показывать сниппет для этой страницы или документа.

В HTTP-заголовке:

или в HTML:

Не индексировать эту страницу для ExampleBot-News, не задавая предпочтений для других.

Эти элементы управления явно указывают одного краулера.

или

ExampleBot не должен показывать сниппет, кроме того, все краулеры не должны переходить по ссылкам на этой странице.

Обратите внимание, что применяются наиболее строгие из действующих директив, поэтому для ExampleBot директива будет объединена как “nosnippet, nofollow“.

или

Выбор механизма REP

Как выбрать подходящий вариант? По сути, robots.txt и элементы управления на уровне страницы похожи, но не полностью взаимозаменяемы.
Иногда требуется действие, возможное только при использовании одного из механизмов: например, если нужно остановить процесс сканирования (как в случае с бесконечными страницами результатов поиска, что возможно через robots.txt), если требуется контроль для FTP-сервера (возможно через robots.txt) или если нужно запретить показ сниппета для страницы (возможно только с помощью элементов на уровне страницы).
Если вам не нужно разделять блокировку сканирования и блокировку индексации, один из подходов — использовать robots.txt для общих настроек (блокировка больших разделов сайта), а элементы управления на уровне страницы — для блокировки отдельных страниц.

Протокол исключения для роботов — мощный, развивающийся стандарт

Все эти элементы управления по своей природе расширяемы. На протяжении многих лет владельцы сайтов, операторы краулеров и поисковые системы работали вместе над их развитием.
Исторически всё началось с нескольких значений, включая noindex и nofollow, затем были приняты такие значения, как nosnippet, noarchive и max-snippet:.
Иногда значения устаревают, как это произошло с noodp, который использовал сниппеты из
DMOZ / Open Directory Project до закрытия каталога.
Существует
множество значений, поддерживаемых Google для владельцев сайтов, и аналогичный объем — другими крупными операторами краулеров.

В рамках REP владельцы сайтов контролируют, что сканируется и как полученные данные используются в поисковых системах.
Это можно делать как на широком уровне для больших частей сайта, так и на очень детальном — для отдельных страниц и даже изображений внутри них.
Эти элементы управления хорошо известны, доступны во всех популярных системах управления контентом, широко поддерживаются коммерческими операторами и используются на миллиардах хостов в интернете сегодня.


Ознакомьтесь с остальными материалами серии Robots Refresher:

Alien Road

Как мы это применяем

Google announcements age. We keep this post here for the record, and we note for clients whether the behaviour it describes still applies today or has since been superseded.

Связанные услуги

Поделиться

© Copyright 2026 Alien Road. All rights reserved.