Обсудить проект

Коротко опишите задачу — этого достаточно для первого контакта.

Практическое SEO · техническая структура

Дубли страниц сайта: откуда они берутся и что с ними делать

Одна и та же страница может оказаться доступной по нескольким URL: с параметрами, через index.php, с разным регистром, слешем или техническим маршрутом CMS. Поисковая система видит несколько адресов с одинаковым содержимым и вынуждена выбирать, какой из них считать основным.

Основа

Что такое дубль страницы

Дубль — это ситуация, когда одинаковое или почти одинаковое содержимое доступно по нескольким адресам. Для пользователя это может выглядеть как одна и та же страница, а для поискового робота — как несколько разных URL, которые нужно обойти и сопоставить.

Яндекс объединяет такие документы в группу дублей и выбирает один URL для показа в поиске. Предпочтительный адрес называют каноническим. Владелец сайта может помочь поисковой системе выбрать основную версию через редирект или rel="canonical", но лучше сначала понять, почему вообще появились лишние адреса.

Один контент

Текст, структура и основная задача страницы практически совпадают.

Разные URL

Одинаковый документ открывается по двум или большему числу адресов.

Выбор канонической версии

Поисковая система решает, какой URL считать главным в группе.

Лишний обход

Робот тратит время на альтернативные адреса вместо новых полезных страниц.

Яндекс о дублировании страниц отдельно отмечает, что из-за дублей нужная страница может быть исключена, а основной URL в поиске — меняться.

Важное различие

Одинаковые ключевые слова и одинаковые Title — не всегда дубли страниц

Две страницы могут упоминать одну тему и при этом быть самостоятельными документами. Например, услуга «перенос сайта» и статья «как перенести сайт на новый домен» тематически близки, но отвечают на разные задачи.

Также одинаковые Title или Description сами по себе не доказывают, что страницы дублируют друг друга. Это отдельная проблема метаданных: пользователю сложнее различать документы в выдаче, а владельцу сайта — понимать структуру. Содержимое страниц при этом может быть совершенно разным.

Дубль страницы — один и тот же или почти одинаковый документ по разным URL. Конкурирующие страницы — разные документы, которые претендуют на один интент. Эти проблемы пересекаются, но исправляются не одинаково.
Когда страницы конкурируют между собой

Шаг 1

Откуда берутся дубли страниц

Большинство дублей появляется не потому, что кто-то специально создаёт копии. Их генерирует CMS, веб-сервер, фильтры каталога, рекламные параметры, старые маршруты или особенности шаблона. Поэтому на аудите полезно искать не отдельный URL, а правило, которое способно породить целую группу адресов.

Слеш и index-файлы

/catalog/, /catalog, /catalog/index.php могут отдавать одно и то же содержимое.

Параметры URL

UTM, сортировка, фильтры, идентификаторы сессий и другие GET-параметры создают альтернативные адреса.

Разные версии домена

HTTP/HTTPS, www/без www и технические домены могут быть доступны одновременно без единого правила перенаправления.

CMS и каталог

Один товар или раздел может выводиться в нескольких ветках структуры по разным URL.

Яндекс отдельно приводит примеры дублей главной страницы через index.php, адресов с UTM-метками и разных технических вариантов URL. Примеры дублей в документации Яндекса.

Шаг 2

GET-параметры: самый незаметный источник лишних URL

Адреса вида ?utm_source=..., ?sort=price, ?page=... или фильтры могут открывать тот же контент под множеством вариантов. Для аналитики параметр полезен, а для поисковой структуры он может быть лишним.

Важно различать параметры, которые действительно меняют содержимое страницы, и параметры, которые только отслеживают источник перехода или порядок вывода. Первые иногда формируют самостоятельные страницы, вторые чаще не должны становиться отдельными поисковыми документами.

Тип параметраПримерЧто меняетсяТипичное решение
Рекламная метка?utm_source=adsСодержимое не меняетсяОставить один канонический URL
Сортировка?sort=priceМеняется порядок элементовОбычно не создавать отдельный поисковый документ
Фильтр?brand=xМеняется набор товаровРешать по спросу и самостоятельному интенту
Пагинация?page=2Меняется часть спискаПроверять архитектуру и роль страниц в обходе

В Яндекс Вебмастере есть отдельная настройка GET-параметров; сам Яндекс отмечает, что параметры могут создавать разные URL с одинаковым содержимым. Настройка GET-параметров в Вебмастере.

Шаг 3

Проверяем технические версии одного URL

У каждого документа должна быть понятная основная версия. Проверяем, не доступны ли одновременно HTTP и HTTPS, www и без www, URL с разным регистром, со слешем и без, с index.php и без него. Если сервер отдаёт одинаковый документ по нескольким адресам, лучше устранить причину на уровне маршрутизации.

Для действительно альтернативных адресов одного документа постоянный редирект обычно понятнее, чем попытка поддерживать несколько равноправных версий. Если же разные URL технически необходимы, canonical помогает указать предпочтительный адрес.

HTTP / HTTPS

Небезопасная версия должна последовательно вести на рабочий HTTPS-адрес.

www / без www

Выбираем одну основную форму домена и используем её во внутренних ссылках.

Регистр

/Page/ и /page/ могут обрабатываться по-разному в зависимости от сервера и CMS.

Слеш и index

Проверяем, не открывается ли один документ через несколько служебных вариантов адреса.

Шаг 4

Как найти дубли на действующем сайте

Начинаем с данных Яндекс Вебмастера и краулинга сайта. В разделе «Страницы в поиске» можно отфильтровать исключённые страницы со статусом «Дубль». Для конкретного URL полезно проверить, какой адрес поисковая система выбрала основным.

Краулер дополняет эту картину: он помогает сгруппировать одинаковые Title, canonical, коды ответа и повторяющийся контент по тысячам URL. Отдельно проверяем шаблоны параметров, фильтры и технические маршруты CMS.

ИсточникЧто ищемЧто это даёт
Яндекс ВебмастерСтатусы «Дубль» и «Неканоническая»Показывает решение поисковой системы по конкретным URL
КраулерПовторяющийся контент, Title, canonical, параметрыНаходит системные шаблоны дублей по всему сайту
Логи сервераЧастые обходы параметрических и технических URLПоказывают, на что реально тратится обход
Ручная проверкаОдинаковый контент по нескольким адресамПомогает понять пользовательский смысл дубля

«Страницы в поиске» в Яндекс Вебмастере показывает статус DUPLICATE для страниц, которые дублируют уже представленную в поиске страницу сайта.

Шаг 5

Как выбрать основной URL

Основная версия должна быть удобной для пользователя, логичной для структуры сайта и использоваться во всех внутренних ссылках. Обычно выбираем короткий стабильный адрес без лишних параметров, технических файлов и промежуточных вариантов.

После выбора проверяем согласованность сигналов: именно этот URL должен находиться в Sitemap, использоваться в меню и контенте, указываться в canonical и быть финальной целью редиректов с альтернативных адресов.

Canonical не должен спорить с остальным сайтом. Если Sitemap и внутренние ссылки ведут на URL A, а rel="canonical" указывает на URL B, поисковой системе приходится разбираться в противоречивых сигналах.
Canonical: основной URL без конфликтовПроверить Sitemap.xml

Шаг 6

301, canonical, noindex или исправление генерации — что выбрать

Правильный способ зависит от причины. Нельзя закрыть любую проблему одной директивой. Иногда лишний URL вообще не должен существовать, иногда он нужен пользователю, но не как самостоятельная поисковая страница, а иногда это полноценный документ, который по ошибке признан дублем.

СитуацияПодходПочему
Один документ случайно доступен по двум адресам301 на основную версиюУбираем альтернативный маршрут и оставляем один URL
Альтернативный URL технически нуженrel="canonical"Подсказываем предпочтительную версию без удаления второго адреса
Служебная страница не должна участвовать в поискеnoindex, если страница должна оставаться доступнойЗапрещаем индексирование, не ломая пользовательский доступ
CMS генерирует тысячи бессмысленных адресовИсправить генерацию и ссылкиЛучше убрать источник дублей, чем бесконечно маскировать последствия
Параметр не меняет содержаниеЕдиный canonical и корректная работа параметровНе создаём отдельный поисковый документ под рекламную или служебную метку

Яндекс воспринимает rel="canonical" как рекомендацию и может выбрать другую основную страницу, если остальные сигналы противоречат указанию. Документация по canonical.

Практический пример

Один товар доступен по четырём адресам

Типичный интернет-магазин может отдавать одну карточку товара через основной URL, адрес с UTM-меткой, технический путь категории и URL после сортировки или фильтра. Для пользователя содержимое одинаковое, а робот видит четыре адреса.

URLЧто происходитРешениеИтог
/catalog/product-a/Основная карточкаОставляем как каноническуюИндексируемый URL
/catalog/product-a/?utm_source=adsТа же карточка с рекламной меткойCanonical на основной URLНе создаём отдельный документ
/category/product-a/CMS создаёт второй маршрут301 на основной URLУбираем альтернативный адрес
/catalog/product-a/?sort=priceСодержимое карточки не меняетсяНе использовать как самостоятельную поисковую страницуСохраняем один основной документ
4 URLодин и тот же товар
1 основной адреспонятная каноническая версия
Меньше шумав Sitemap, ссылках и обходе

Главная задача — не просто поставить canonical на все варианты, а понять, почему сайт создаёт лишние маршруты и какие из них можно устранить архитектурно.

Отдельный сценарий

Дубли после редизайна или переноса сайта

После миграции часто остаются старые URL, а новая CMS создаёт собственные адреса. Если старые страницы продолжают отвечать 200 вместо редиректа, поисковая система видит одновременно старую и новую версии одного документа.

Похожая проблема возникает с тестовым доменом, временным поддоменом или копией сайта на новом сервере. Если такая версия доступна роботу и не закрыта, она может создавать дополнительные группы дублей.

Старый URL отвечает 200

Новая страница уже существует, но старая версия не перенаправлена.

Тестовый домен открыт

Копия production доступна поисковому роботу как отдельный набор адресов.

Canonical остался старым

Новая страница сама указывает предпочтительным прежний URL.

Sitemap содержит обе версии

Сайт одновременно сообщает поисковику о старой и новой структуре.

SEO при переносе сайтаПереезд на новый домен

Чек-лист

Как найти и убрать дубли страниц

  1. Определить основные типы URL: главная, категории, карточки, статьи, фильтры, пагинация и служебные страницы.
  2. Проверить технические версии: HTTP/HTTPS, www/без www, регистр, слеши и index-файлы.
  3. Собрать параметры: UTM, сортировки, фильтры, сессии и другие GET-параметры.
  4. Посмотреть Вебмастер: страницы со статусом «Дубль» и «Неканоническая».
  5. Прокраулить сайт: найти одинаковый контент, Title, canonical и повторяющиеся шаблоны URL.
  6. Выбрать основной адрес: понятный, стабильный и используемый во внутренних ссылках.
  7. Устранить лишние маршруты: где возможно, настроить прямой 301 на основную версию.
  8. Использовать canonical осознанно: только когда альтернативный URL действительно должен оставаться доступным.
  9. Не маскировать генерацию: если CMS создаёт тысячи бесполезных URL, исправить источник.
  10. Обновить Sitemap: оставить только актуальные канонические адреса.
  11. Обновить внутренние ссылки: сайт должен ссылаться сразу на основные URL.
  12. Перепроверить после обхода: убедиться, что поисковая система видит правильную основную версию.

Вопросы

Короткие ответы

Дубли страниц — это всегда санкция?

Нет. Чаще это техническая проблема структуры: поисковая система объединяет одинаковые документы и выбирает один основной URL. Но большое число лишних адресов усложняет обход и может привести к выбору не той версии страницы, которую ожидает владелец.

Нужно ли закрывать все дубли в robots.txt?

Нет. Robots.txt управляет обходом и не является универсальным способом выбора основной версии. Для разных ситуаций подходят редирект, canonical, noindex или исправление генерации URL.

Можно ли решить всё через rel="canonical"?

Нет. Canonical — рекомендация поисковой системе. Если можно вообще убрать лишний маршрут или сделать постоянный редирект на единственную рабочую версию, это часто понятнее архитектурно.

Одинаковые Title означают, что страницы дубли?

Не обязательно. Заголовки могут совпасть у разных документов из-за шаблона CMS. Это отдельная проблема метаданных, которую нужно проверить, но дубль определяется прежде всего одинаковым или почти одинаковым содержимым.

Что делать с фильтрами каталога?

Разделить фильтры на те, которые имеют самостоятельный поисковый спрос и полезную посадочную задачу, и технические комбинации без отдельной ценности. Не каждый URL фильтра должен индексироваться.

Практика NIC-SEO

Не закрывать симптомы, а убрать причину появления лишних URL

Мы сначала выясняем, как CMS, сервер или структура создают альтернативные адреса, затем выбираем один основной документ и приводим к нему редиректы, canonical, Sitemap и внутренние ссылки.