Обсудить проект

Коротко опишите задачу — этого достаточно для первого контакта.

Практическое SEO · индексация

robots.txt и noindex: как не закрыть важные страницы сайта

robots.txt управляет обходом, а noindex — участием страницы в поиске. Ошибка возникает, когда эти механизмы смешивают: закрывают URL в robots.txt и одновременно ждут, что робот увидит noindex, или случайно переносят тестовые запреты на production.

Главное различие

robots.txt и noindex решают разные задачи

robots.txt сообщает роботу, какие URL или разделы не нужно загружать. noindex сообщает, что текст конкретной страницы не должен участвовать в результатах поиска.

Это принципиально важно: закрытый в robots.txt URL всё равно может быть известен поисковой системе из ссылок и других источников. Яндекс прямо отмечает, что такие страницы могут участвовать в поиске. Чтобы удалить страницу из поиска, нужен noindex или другой корректный способ исключения.

МеханизмЧто контролируетГде задаётсяТипичная задача
robots.txtОбход URLКорень сайтаНе тратить обход на служебные разделы
meta robots noindexУчастие страницы в поискеhead HTMLОставить страницу доступной, но исключить из поиска
X-Robots-TagТо же, что meta robotsHTTP-заголовокУправлять HTML и не-HTML документами на сервере

Шаг 1

Как работает robots.txt

Файл должен находиться в корне сайта, называться robots.txt и быть доступен роботу. Яндекс указывает, что файл должен отвечать кодом 200 OK; размер файла ограничен 500 КБ.

Через правила User-agent, Disallow и Allow можно ограничивать обход конкретных путей. Это удобно для внутренних поисков, служебных разделов, административных маршрутов и других URL, которые не должны регулярно обходиться.

Требования Яндекса к robots.txt.

Шаг 2

Как работает noindex

Директиву можно задать метатегом <meta name="robots" content="noindex"> в HTML или HTTP-заголовком X-Robots-Tag: noindex. Яндекс указывает, что такая страница не будет участвовать в результатах поиска.

Для обычной HTML-страницы удобен meta robots. Для PDF, изображений или других типов документов полезен X-Robots-Tag, потому что у них нет HTML-блока head.

Метатеги robots и X-Robots-Tag в документации Яндекса.

Шаг 3

Почему Disallow и noindex могут конфликтовать

Если страница запрещена в robots.txt, робот не загружает её содержимое и поэтому не видит метатег noindex или HTTP-заголовок X-Robots-Tag. Яндекс прямо предупреждает: для удаления уже известной страницы из поиска не нужно одновременно закрывать её в robots.txt.

Практическая логика простая: если нужно, чтобы робот увидел noindex, страница должна быть доступна для обхода. После того как запрет обработан и URL исключён из поиска, архитектуру можно дополнительно пересмотреть, если обход страницы больше не нужен.

Ошибка вида Disallow + noindex часто выглядит логично владельцу сайта, но робот не может прочитать noindex у страницы, которую ему запретили загружать.

Шаг 4

Какие страницы действительно стоит ограничивать

Неиндексируемая страница — не обязательно плохая страница. На сайте есть URL, которые нужны пользователю или системе, но не должны становиться отдельными поисковыми документами.

Административные и служебные разделы

Панели управления, внутренние маршруты и технические эндпоинты не предназначены для поискового трафика.

Внутренний поиск

Результаты поиска по сайту способны генерировать бесконечное число слабых комбинаций URL.

Личные кабинеты

Персональные страницы пользователя не имеют смысла как общедоступные поисковые документы.

Технические фильтры

Комбинации без самостоятельного спроса и содержания часто не нужны в индексе.

Для конфиденциальной информации robots.txt и noindex не являются защитой доступа. Такие данные должны быть закрыты авторизацией и серверными правами.

Шаг 5

Какие страницы опасно закрывать без проверки

Случайные запреты часто затрагивают целые шаблоны. Одна строка в robots.txt способна закрыть каталог, статьи, изображения, CSS или JavaScript, если правило получилось слишком широким.

Что закрылиПочему это опасноЧто проверить
Категории каталогаИз поиска выпадает целый коммерческий кластерШаблон Disallow и фактические URL
CSS/JS ресурсыРобот может хуже понять итоговое отображение страницыНужны ли ресурсы для рендеринга
ПагинациюМожно ухудшить обнаружение товаров и материалов глубже первой страницыКак построена навигация и внутренние ссылки
Новые статьиШаблонный noindex после staging может массово попасть в productionHead всех типов страниц после deploy

Шаг 6

Staging и production: где чаще всего забывают запреты

Тестовую копию сайта действительно нужно защищать от попадания в поиск, но переносить её ограничения в production нельзя. После запуска проверяем robots.txt, meta robots и X-Robots-Tag на главной, категориях, карточках и статьях.

Самый опасный сценарий — когда staging закрывали глобальным noindex в шаблоне, а при переносе код остался тем же. Внешне сайт работает идеально, но поисковая система получает прямой запрет на индексирование всех страниц.

SEO после переноса сайтаДиагностика индексации

Шаг 7

Как проверить, что страница не закрыта случайно

Проверяем три уровня отдельно: robots.txt, HTML-метатег и HTTP-заголовок. Ошибка может находиться только в одном из них.

01

robots.txt

Подходит ли URL под Disallow и нет ли более широкого правила.

02

Meta robots

Есть ли noindex или none в head страницы.

03

X-Robots-Tag

Не отдаёт ли сервер noindex через HTTP-заголовок.

04

HTTP-ответ

Страница должна открываться ожидаемым кодом и без неожиданного редиректа.

05

Шаблон

Не повторяется ли запрет на всех страницах одного типа.

06

Вебмастер

Есть ли причина исключения META_NO_INDEX или запрет обхода.

07

После исправления

Отправить важный URL на переобход.

08

Проверить соседние URL

Чтобы исправление одной страницы не скрывало массовую ошибку шаблона.

Практический пример

Почему новая категория не появляется в поиске

ПроверкаРезультатЧто это значитДействие
HTTP200 OKСтраница доступнаИдём дальше
robots.txtРаздел не закрытОбход разрешёнПроверяем head
Meta robotsnoindexСтраница сама запрещает участие в поискеУдалить запрет, если категория должна индексироваться
Шаблонnoindex есть у всех новых категорийПроблема массоваяИсправить шаблон, а не одну страницу
После deployindexableЗапрет снятОтправить важные URL на переобход
Симптомстраница не в поиске
Причинашаблонный noindex
Исправлениешаблон + переобход

Частые ошибки

Где чаще всего закрывают не то

Disallow + noindex

Робот не загружает страницу и не видит запрет индексирования внутри неё.

Глобальный noindex после staging

Тестовая настройка переносится в production.

Слишком широкая маска

Правило закрывает не только служебный раздел, но и полезные страницы с похожим путём.

robots.txt как защита данных

Файл публичный и не заменяет авторизацию или серверные права.

Закрытые CSS/JS

Робот не получает ресурсы, нужные для понимания страницы.

nofollow без причины

Можно ухудшить обнаружение внутренних страниц и нарушить логичную навигацию.

Чек-лист

Проверка robots.txt и noindex

  1. Открыть robots.txt: файл существует в корне и отвечает 200.
  2. Проверить важные разделы: они не попадают под случайный Disallow.
  3. Проверить meta robots: на индексируемых страницах нет noindex и none.
  4. Проверить X-Robots-Tag: сервер не отдаёт скрытый noindex.
  5. Не совмещать Disallow и noindex без понимания: робот должен увидеть директиву noindex.
  6. Проверить staging-настройки: тестовые запреты не попали в production.
  7. Проверить CSS/JS: важные ресурсы доступны роботу.
  8. Проверить служебные URL: внутренний поиск, кабинеты и технические страницы не создают лишнюю индексацию.
  9. Не использовать robots.txt как защиту данных: приватное закрывается авторизацией.
  10. Проверить шаблоны: одна ошибка не повторяется на тысячах страниц.
  11. Посмотреть Вебмастер: причины исключения страниц.
  12. После исправления: переобойти важные URL и проверить результат.

Вопросы

Короткие ответы

Если закрыть страницу в robots.txt, она исчезнет из поиска?

Не обязательно. Яндекс прямо указывает, что известный URL может участвовать в поиске даже при запрете обхода.

Что использовать, чтобы убрать страницу из поиска?

Если страница должна оставаться доступной, используйте noindex в HTML или X-Robots-Tag. Если страницы больше не существует, корректнее вернуть соответствующий HTTP-код.

Можно ли одновременно Disallow и noindex?

Технически можно задать оба правила, но робот, которому запрещён обход, не увидит noindex на странице. Поэтому для удаления уже известного URL это плохая комбинация.

Нужно ли указывать index, follow на обычных страницах?

Нет, разрешающие директивы действуют по умолчанию, если нет запрещающих указаний.

Как закрыть PDF от поиска?

Через HTTP-заголовок X-Robots-Tag: noindex, потому что у PDF нет HTML-метатега в head.

Практика NIC-SEO

Сначала понять, что именно нужно запретить: обход или поиск

Мы разделяем эти задачи и только после этого выбираем robots.txt, noindex, X-Robots-Tag, авторизацию или HTTP-код.