Административные и служебные разделы
Панели управления, внутренние маршруты и технические эндпоинты не предназначены для поискового трафика.
Практическое SEO · индексация
robots.txt управляет обходом, а noindex — участием страницы в поиске. Ошибка возникает, когда эти механизмы смешивают: закрывают URL в robots.txt и одновременно ждут, что робот увидит noindex, или случайно переносят тестовые запреты на production.
Главное различие
robots.txt сообщает роботу, какие URL или разделы не нужно загружать. noindex сообщает, что текст конкретной страницы не должен участвовать в результатах поиска.
Это принципиально важно: закрытый в robots.txt URL всё равно может быть известен поисковой системе из ссылок и других источников. Яндекс прямо отмечает, что такие страницы могут участвовать в поиске. Чтобы удалить страницу из поиска, нужен noindex или другой корректный способ исключения.
| Механизм | Что контролирует | Где задаётся | Типичная задача |
|---|---|---|---|
| robots.txt | Обход URL | Корень сайта | Не тратить обход на служебные разделы |
| meta robots noindex | Участие страницы в поиске | head HTML | Оставить страницу доступной, но исключить из поиска |
| X-Robots-Tag | То же, что meta robots | HTTP-заголовок | Управлять HTML и не-HTML документами на сервере |
Шаг 1
Файл должен находиться в корне сайта, называться robots.txt и быть доступен роботу. Яндекс указывает, что файл должен отвечать кодом 200 OK; размер файла ограничен 500 КБ.
Через правила User-agent, Disallow и Allow можно ограничивать обход конкретных путей. Это удобно для внутренних поисков, служебных разделов, административных маршрутов и других URL, которые не должны регулярно обходиться.
Шаг 2
Директиву можно задать метатегом <meta name="robots" content="noindex"> в HTML или HTTP-заголовком X-Robots-Tag: noindex. Яндекс указывает, что такая страница не будет участвовать в результатах поиска.
Для обычной HTML-страницы удобен meta robots. Для PDF, изображений или других типов документов полезен X-Robots-Tag, потому что у них нет HTML-блока head.
Шаг 3
Если страница запрещена в robots.txt, робот не загружает её содержимое и поэтому не видит метатег noindex или HTTP-заголовок X-Robots-Tag. Яндекс прямо предупреждает: для удаления уже известной страницы из поиска не нужно одновременно закрывать её в robots.txt.
Практическая логика простая: если нужно, чтобы робот увидел noindex, страница должна быть доступна для обхода. После того как запрет обработан и URL исключён из поиска, архитектуру можно дополнительно пересмотреть, если обход страницы больше не нужен.
Шаг 4
Неиндексируемая страница — не обязательно плохая страница. На сайте есть URL, которые нужны пользователю или системе, но не должны становиться отдельными поисковыми документами.
Панели управления, внутренние маршруты и технические эндпоинты не предназначены для поискового трафика.
Результаты поиска по сайту способны генерировать бесконечное число слабых комбинаций URL.
Персональные страницы пользователя не имеют смысла как общедоступные поисковые документы.
Комбинации без самостоятельного спроса и содержания часто не нужны в индексе.
Для конфиденциальной информации robots.txt и noindex не являются защитой доступа. Такие данные должны быть закрыты авторизацией и серверными правами.
Шаг 5
Случайные запреты часто затрагивают целые шаблоны. Одна строка в robots.txt способна закрыть каталог, статьи, изображения, CSS или JavaScript, если правило получилось слишком широким.
| Что закрыли | Почему это опасно | Что проверить |
|---|---|---|
| Категории каталога | Из поиска выпадает целый коммерческий кластер | Шаблон Disallow и фактические URL |
| CSS/JS ресурсы | Робот может хуже понять итоговое отображение страницы | Нужны ли ресурсы для рендеринга |
| Пагинацию | Можно ухудшить обнаружение товаров и материалов глубже первой страницы | Как построена навигация и внутренние ссылки |
| Новые статьи | Шаблонный noindex после staging может массово попасть в production | Head всех типов страниц после deploy |
Шаг 6
Тестовую копию сайта действительно нужно защищать от попадания в поиск, но переносить её ограничения в production нельзя. После запуска проверяем robots.txt, meta robots и X-Robots-Tag на главной, категориях, карточках и статьях.
Самый опасный сценарий — когда staging закрывали глобальным noindex в шаблоне, а при переносе код остался тем же. Внешне сайт работает идеально, но поисковая система получает прямой запрет на индексирование всех страниц.
Шаг 7
Проверяем три уровня отдельно: robots.txt, HTML-метатег и HTTP-заголовок. Ошибка может находиться только в одном из них.
Подходит ли URL под Disallow и нет ли более широкого правила.
Есть ли noindex или none в head страницы.
Не отдаёт ли сервер noindex через HTTP-заголовок.
Страница должна открываться ожидаемым кодом и без неожиданного редиректа.
Не повторяется ли запрет на всех страницах одного типа.
Есть ли причина исключения META_NO_INDEX или запрет обхода.
Отправить важный URL на переобход.
Чтобы исправление одной страницы не скрывало массовую ошибку шаблона.
Практический пример
| Проверка | Результат | Что это значит | Действие |
|---|---|---|---|
| HTTP | 200 OK | Страница доступна | Идём дальше |
| robots.txt | Раздел не закрыт | Обход разрешён | Проверяем head |
| Meta robots | noindex | Страница сама запрещает участие в поиске | Удалить запрет, если категория должна индексироваться |
| Шаблон | noindex есть у всех новых категорий | Проблема массовая | Исправить шаблон, а не одну страницу |
| После deploy | indexable | Запрет снят | Отправить важные URL на переобход |
Частые ошибки
Робот не загружает страницу и не видит запрет индексирования внутри неё.
Тестовая настройка переносится в production.
Правило закрывает не только служебный раздел, но и полезные страницы с похожим путём.
Файл публичный и не заменяет авторизацию или серверные права.
Робот не получает ресурсы, нужные для понимания страницы.
Можно ухудшить обнаружение внутренних страниц и нарушить логичную навигацию.
Чек-лист
Вопросы
Не обязательно. Яндекс прямо указывает, что известный URL может участвовать в поиске даже при запрете обхода.
Если страница должна оставаться доступной, используйте noindex в HTML или X-Robots-Tag. Если страницы больше не существует, корректнее вернуть соответствующий HTTP-код.
Технически можно задать оба правила, но робот, которому запрещён обход, не увидит noindex на странице. Поэтому для удаления уже известного URL это плохая комбинация.
Нет, разрешающие директивы действуют по умолчанию, если нет запрещающих указаний.
Через HTTP-заголовок X-Robots-Tag: noindex, потому что у PDF нет HTML-метатега в head.
Практика NIC-SEO
Мы разделяем эти задачи и только после этого выбираем robots.txt, noindex, X-Robots-Tag, авторизацию или HTTP-код.