WebNeon.
4 мин чтения

Дубли страниц: чем опасны и как убрать

Откуда берутся дубли, почему они мешают продвижению, как их найти за полчаса и какими способами закрывать — редиректами, каноническими адресами или запретом индексации.

Дубли страниц: чем опасны и как убрать

Дубли — одна из самых распространённых технических проблем и одна из самых незаметных: сайт выглядит нормально, работает нормально, а в поиске не растёт.

Разбираем, откуда они берутся, как найти и чем закрывать.

Чем они мешают

Поиск не знает, какую версию показывать. Две одинаковые страницы конкурируют между собой, и вместо одной сильной вы получаете две слабых.

Вес размывается. Внутренние и внешние ссылки распределяются между копиями вместо того, чтобы усиливать одну страницу.

Тратится краулинговый бюджет. Робот обходит копии вместо новых страниц. На молодом сайте с ограниченным вниманием поисковой системы это прямо тормозит индексацию — почему это критично, разобрано в статье почему сайт не появляется в поиске.

Откуда берутся

Технические адреса

Самый частый источник, и владелец сайта его обычно не подозревает. Проверьте, открывается ли ваш сайт одновременно по всем этим адресам:

  • с www и без;
  • по http и https;
  • со слешем на конце и без;
  • главная по /index.php, /index.html или подобному;
  • с заглавными буквами в адресе.

Каждый вариант, который открывается и отдаёт то же содержимое, — формально отдельная страница.

Параметры в адресе

Фильтры, сортировка, пагинация, рекламные метки, идентификаторы сессий. Один и тот же каталог с разной сортировкой — это два адреса с почти одинаковым содержимым.

Особенно много дублей плодят каталоги с фильтрами: комбинации параметров дают сотни адресов.

Дубли контента

Один и тот же текст на разных страницах. Типичные случаи:

  • версии для печати;
  • товар, доступный в нескольких категориях по разным адресам;
  • страницы пагинации, где повторяется описание раздела;
  • программные страницы-клоны — гео-страницы или страницы под ниши, где меняется только название в шаблоне.

Последний пункт заслуживает отдельного внимания. Поиск распознаёт шаблонные клоны и не ранжирует их. Именно поэтому в собственном гео-разделе мы не публикуем город, у которого нет уникального текста, своих вопросов и своего состава услуг: страница без содержания хуже, чем её отсутствие.

Как найти

За пять минут: откройте сайт по всем вариантам технических адресов из списка выше. Если открывается больше одного — проблема есть.

За полчаса: посмотрите в панелях вебмастеров разделы про дубли и исключённые страницы. Там прямо перечислены адреса, которые поиск считает копиями.

Проверьте канонические адреса. На каждой странице должен быть указан её основной адрес. Отсутствие или ошибка здесь — частая причина дублей.

Чем закрывать

Три инструмента, и важно не перепутать, когда какой.

Постоянный редирект

Когда: технические дубли — www, http, слеш, index. То есть когда одна из версий не должна существовать вообще.

Одна версия выбирается основной, все остальные перенаправляются на неё. Старый адрес перестаёт открываться, вес передаётся.

Канонический адрес

Когда: страница должна остаться доступной, но не должна конкурировать. Классика — страницы с параметрами фильтров и сортировки.

Посетитель пользуется фильтром, страница работает, но поиску сообщается: основная версия — вот эта.

Важно: канонический адрес — рекомендация, а не приказ. Поиск может её проигнорировать, если содержимое сильно различается.

Запрет индексации

Когда: страница нужна людям, но не нужна в поиске: результаты внутреннего поиска, служебные разделы, страницы корзины.

Важная деталь: не закрывайте такие страницы в файле для роботов — тогда робот не увидит и запрещающий тег на них. Правильнее оставить доступ и указать запрет в самом теге.

Особый случай: пагинация

Страницы вида «страница 2, 3, 4» — не совсем дубли, но обращаться с ними нужно осознанно.

Работающий подход: у каждой страницы пагинации свой канонический адрес — она сама, а не первая страница. Заголовки при этом различаются номером страницы.

Что не стоит делать: закрывать пагинацию от индексации полностью — тогда робот не дойдёт до старых материалов по ссылкам.

Как не создавать дубли

Профилактика дешевле лечения:

  • один вариант адреса выбирается на этапе разработки и настраивается редиректами;
  • канонические адреса генерируются автоматически из данных страницы;
  • рекламные метки не создают новых адресов для индексации;
  • программные страницы публикуются только с уникальным содержанием;
  • при переносе или редизайне адреса сохраняются, а изменившиеся закрываются редиректами — как это делается, в статье миграция с WordPress.

Всё это закладывается при разработке практически бесплатно — в отличие от разбора накопившихся дублей потом. Это один из тех пунктов, что входят в базу из статьи SEO для нового сайта.

Итог

Дубли не ломают сайт визуально, но тормозят его в поиске: размывают вес и тратят внимание робота.

Начните с проверки технических адресов — это пять минут и самая частая причина. Дальше: канонические адреса на всех страницах, разумная работа с параметрами, уникальное содержание на программных страницах.

И правило для любых массовых страниц: нет уникального содержания — нет страницы. Клон в индексе не помогает, а мешает.

Частые вопросы

Чем опасны дубли страниц?+

Поиск не понимает, какую версию показывать, и вес распределяется между копиями вместо одной страницы. Плюс дубли расходуют краулинговый бюджет: робот тратит обходы на копии вместо новых страниц. На молодом сайте это заметно тормозит индексацию.

Откуда берутся дубли, если я их не создавал?+

Из технических адресов: сайт открывается с www и без, по http и https, со слешем на конце и без. Плюс параметры фильтров, сортировки и рекламные метки — каждый вариант формально отдельный адрес с тем же содержимым.

Чем канонический адрес отличается от редиректа?+

Редирект физически перенаправляет посетителя и робота на другой адрес — старый перестаёт открываться. Канонический адрес оставляет страницу доступной, но сообщает поиску, какую версию считать основной. Первое для технических дублей, второе для страниц с параметрами.

Считается ли одинаковый текст на разных страницах дублем?+

Да, и это частая проблема программных страниц: гео-страницы или страницы под ниши, где меняется только название в шаблоне. Поиск распознаёт такие клоны и не ранжирует их. Уникальное содержание здесь не рекомендация, а условие работоспособности.

Читайте также