Обсудить проект

Коротко опишите задачу — этого достаточно для первого контакта.

Практическое SEO · crawl

Обход сайта поисковым роботом: как не тратить crawl budget на мусорные URL

Поисковый робот не обходит сайт бесконечно быстро. На крупных проектах тысячи параметров, дублей, календарей и технических страниц могут забирать значительную часть запросов. Задача не в том, чтобы «увеличить crawl budget», а в том, чтобы важные URL были доступны, а служебный хвост не доминировал в обходе.

Основа

Робот распределяет запросы между известными URL сайта

Яндекс постоянно обходит сайты и сам рассчитывает оптимальную скорость запросов, чтобы получить максимум страниц без лишней нагрузки на сервер. В Вебмастере скорость обхода можно настраивать, но сначала нужно понять, какие URL робот реально запрашивает.

На маленьком сайте разговор о crawl budget обычно вторичен. На каталоге с миллионами параметров он становится практической задачей: робот может многократно обходить служебные комбинации вместо новых товаров и обновлённых категорий.

Яндекс о скорости обхода сайта рекомендует перед изменением лимита анализировать логи и статистику обхода.

Первый вопрос не «как заставить робота ходить чаще», а «на какие страницы он тратит текущие запросы».

Шаг 1

Параметры, дубли и бесконечные пространства URL создают основной технический шум

Фильтры, сортировки, календарные страницы, сессии, внутренний поиск и разные порядки query-параметров способны создать фактически бесконечное число адресов.

Если интерфейс генерирует обычные ссылки на эти комбинации, робот будет их обнаруживать даже при отсутствии в Sitemap. Поэтому лечить только XML-карту недостаточно.

Фасеты

Все комбинации характеристик становятся ссылками.

Сортировки

Один список доступен в десятках порядков.

Календарь

Ссылки уходят на годы вперёд или назад.

Параметры

Одинаковое содержимое создаётся разным порядком query-string.

Шаг 2

Важные страницы должны быть легко обнаружимы и быстро отвечать

Новый товар, обновлённая категория или статья должны иметь внутренние ссылки, корректный Sitemap и стабильный серверный ответ. Не нужно надеяться, что увеличение crawl rate компенсирует слабую архитектуру.

Глубина, сироты и медленный backend напрямую влияют на то, насколько эффективно робот может получать полезные страницы.

Глубина и сиротыСкорость сайта

Шаг 3

Ограничиваем обход только после классификации технических URL

Robots.txt может уменьшить обход явно бесполезных разделов и параметров, но запрет нельзя ставить вслепую. Если роботу нужно увидеть noindex или canonical, закрытый URL он не сможет полноценно обработать.

Сначала решаем, нужен ли URL пользователю, поиску и роботу, затем выбираем подход: убрать ссылку, нормализовать параметр, canonical, noindex, robots или прекращение генерации.

Robots.txt и noindexФильтры каталога

Шаг 4

Не увеличиваем скорость обхода, если сервер уже работает на пределе

Частые запросы робота могут усиливать нагрузку на слабый backend. Яндекс позволяет уменьшить рекомендуемую скорость, но это временная мера: параллельно нужно понять, почему страницы отвечают медленно.

5xx и таймауты во время обхода хуже, чем более редкое, но стабильное получение документов.

HTTP-коды и 5xxАнализ серверных логов

Шаг 5

Вебмастер показывает, какие URL и коды робот получал

В статистике обхода можно фильтровать страницы по дате, пути и ответу сервера. Это помогает быстро увидеть 404, разделы с параметрами и новые URL, которые робот не смог загрузить.

Но для детальной картины нужны серверные логи: там видны все запросы, частота, user-agent, время и конкретный ответ сервера.

SEO-анализ логов

Шаг 6

Сравниваем структуру URL с фактическими запросами робота

Берём период логов, выделяем подтверждённых поисковых роботов и группируем URL по шаблонам. Считаем долю категорий, товаров, фильтров, 404, редиректов и служебных адресов.

Если большая часть обхода приходится на URL без поисковой ценности, исправляем источник: ссылки, параметры, генерацию или правила доступа. Только после этого оцениваем необходимость изменения crawl rate.

Группа URLДоля обходаЧто проверить
Товары/статьиВысокаяНормально, если это основной объём сайта
Фильтры и сортировкиВысокаяГенерацию ссылок и параметры
404ВысокаяВнутренние и внешние источники старых URL
301ВысокаяВнутренние ссылки и старые маршруты
5xxЛюбая заметнаяСтабильность сервера

Шаг 7

Измеряем не только число запросов, но и качество обхода

Успех — не обязательно меньше запросов. Важнее, чтобы доля полезных канонических 200 URL выросла, новые страницы обнаруживались быстрее, а технический хвост уменьшался.

Повторяем анализ на сопоставимом периоде и фиксируем изменения. На сезонных и быстро меняющихся сайтах картину полезно проверять регулярно.

Частые ошибки

Что обычно ломает эту часть SEO

Увеличивать crawl rate первым шагом

Сервер получает больше тех же бесполезных запросов.

Оптимизировать маленький сайт как маркетплейс

Crawl budget отвлекает от более важных проблем.

Закрывать параметры без анализа

Можно скрыть URL, на которых робот должен увидеть другие директивы.

Не проверять источники ссылок

Технические URL продолжают создаваться интерфейсом.

Практический сценарий

70% запросов робота уходят на сортировки

Логи крупного каталога показывают: канонические товары и категории получают меньше трети запросов YandexBot, остальное — ?sort=, ?view= и комбинации фильтров. Увеличение crawl rate лишь сильнее нагружает сервер.

Находим ссылки, которые генерируют технические параметры, отделяем поисковые фасеты от служебных и прекращаем бесконечное пространство URL. Через следующий период логов доля полезных 200 растёт без искусственного повышения скорости обхода.

ГруппаДоПосле
Канонические товары/категории28% запросов68%
Сортировки31%5%
Технические фильтры39%20%
Ошибки/прочее2%7% — отдельно разбираем новые источники

Чек-лист

Проверка эффективности обхода

  1. Посмотреть статистику обхода: Какие разделы и коды получает робот.
  2. Взять серверные логи: Проверить фактические запросы по URL.
  3. Сгруппировать шаблоны: Категории, товары, фильтры, параметры и ошибки.
  4. Найти технический хвост: URL без поисковой ценности.
  5. Проверить источники ссылок: Почему робот обнаруживает эти адреса.
  6. Убрать лишнюю генерацию: Не создавать бесконечные комбинации.
  7. Настроить robots осознанно: Не скрывать страницы, где нужно прочитать noindex/canonical.
  8. Проверить важные URL: Они доступны по ссылкам и быстро отвечают.
  9. Не перегружать сервер: 5xx важнее искусственного роста crawl rate.
  10. Повторить анализ: Сравнить долю полезных обходов после изменений.

Вопросы

Короткие ответы

Нужно ли думать о crawl budget маленькому сайту?

Обычно это не приоритет. Важнее структура, индексируемость и качество страниц.

Можно ли просто увеличить crawl rate?

Можно задать рекомендацию, но сначала стоит устранить мусорные URL и убедиться, что сервер выдерживает нагрузку.

Sitemap экономит crawl budget?

Он помогает сообщить о важных URL, но не мешает роботу находить технические адреса по ссылкам.

Как понять, что робот тратит обход впустую?

По статистике обхода и логам: большая доля параметров, дублей, редиректов и ошибок — явный сигнал.

Практика NIC-SEO

Оптимизируем не цифру crawl rate, а качество обхода

Мы убираем технические пространства URL и делаем важные документы легко доступными, быстрыми и связанными нормальной навигацией.