Пагинация сама по себе не проблема. Проблема начинается, когда в индексе появляются десятки почти одинаковых страниц архивов, рубрик или блога: /page/2/, /page/3/ и дальше. Поисковик тратит обход на слабые страницы, а в отчётах всплывают дубли и «Просканировано, но не проиндексировано». При этом закрывать пагинацию грубо через Disallow в robots.txt обычно плохая идея: робот перестаёт нормально видеть ссылки и структуру архива.
Когда пагинация превращается в проблему
Сценарий типичный: у сайта есть рубрики, теги, архивы автора или блог с большим количеством записей. Первая страница архива важна для индексации, а страницы 2, 3, 4 и дальше почти не несут самостоятельной ценности. Если на них повторяются одинаковые title, description и блоки контента, это уже технический дубль, а не полезная посадочная.
Проверять нужно не только сам факт наличия /page/2/, но и то, как они отдаются поисковику. Часто проблема не в пагинации как таковой, а в том, что тема или SEO-плагин не проставляют canonical, а в шаблоне архива одинаковые мета-теги на всех страницах.
Быстрая диагностика
Сначала посмотрите исходный код нескольких страниц архива:
- главная страница архива;
/page/2/;/page/3/;- любая рубрика с несколькими страницами.
Ищите три вещи: canonical, мета-robots и одинаковые заголовки. Если на второй странице каноникал указывает на первую, это нормально. Если каноникал отсутствует или указывает на саму страницу без необходимости, нужно править логику шаблона или SEO-плагина.
Дополнительно проверьте в Google Search Console разделы с дублями и исключёнными страницами. Если там много пагинированных URL, а контент на них почти повторяется, это уже кандидат на техническую чистку.
Что именно закрывать, а что оставить
Не стоит пытаться закрыть всё подряд. Первая страница архива обычно должна оставаться индексируемой. Закрывать имеет смысл только страницы пагинации, которые не дают новой смысловой нагрузки. Для новостных сайтов и больших каталогов иногда полезно оставить часть пагинации открытой, если на ней реально есть уникальные материалы и сильная внутренняя перелинковка. Но это уже решение по конкретному проекту, а не универсальное правило.
| Подход | Что делает | Когда использовать | Минус |
|---|---|---|---|
| noindex, follow | Страница не попадает в индекс, ссылки можно обходить | Для архивов с дублями и слабой ценностью | Нужно следить, чтобы мета-robots не конфликтовал с каноникалом |
| canonical на первую страницу | Подсказывает поисковику основную версию | Когда пагинация нужна пользователю, но не нужна в индексе | Не всегда достаточно без noindex |
| Disallow в robots.txt | Запрещает обход URL | Редко, только для явно мусорных разделов | Поисковик может не увидеть каноникал и внутренние ссылки |
Пошаговое решение: закрываем пагинацию корректно
Самый безопасный вариант — оставить доступ для обхода, но запретить индексацию страниц пагинации. Это можно сделать через SEO-плагин или кодом. Если у вас уже стоит плагин, который управляет мета-robots и canonical, сначала проверьте его настройки. Если нет — проще и надёжнее добавить логику в тему или мини-плагин.
Вариант 1. Через код: noindex для страниц пагинации
Этот способ подходит, если нужно точечно управлять архивами без лишних зависимостей. Код можно добавить в functions.php дочерней темы или в свой небольшой плагин.
add_filter('wp_robots', function (array $robots) {
if (is_paged() && (is_home() || is_archive() || is_search())) {
$robots['noindex'] = true;
$robots['follow'] = true;
}
return $robots;
});
Что делает этот код: на страницах пагинации блога, архивов и поиска добавляет noindex, follow. Поисковик может пройти по ссылкам, но не должен сохранять саму страницу в индексе.
Вариант 2. Каноникал на первую страницу архива
Если тема или SEO-плагин не выставляют каноникал так, как нужно, можно принудительно указать первую страницу архива как основную. Делать это стоит аккуратно: не ломайте каноникал на страницах, где он нужен сам на себя.
add_filter('get_canonical_url', function ($canonical, $post) {
if (is_paged() && (is_home() || is_archive())) {
return get_pagenum_link(1);
}
return $canonical;
}, 10, 2);
Этот вариант полезен как дополнительный сигнал, но я бы не использовал его в одиночку без noindex, если задача именно убрать дубли из индекса.
Вариант 3. Настройка через SEO-плагин
Если на сайте уже используется плагин для SEO, проверьте, умеет ли он управлять индексированием архивов и пагинации. Важно не включать сразу несколько механизмов, которые пишут разные meta robots. Типичная ошибка — плагин ставит noindex, а тема или кастомный код подменяют canonical и ломают логику.
Если вы используете Clearfy Pro, его имеет смысл рассматривать как инструмент для общей технической чистки: закрытие дублей, системных страниц и лишних элементов. Но даже в этом случае сначала проверьте, что именно он меняет в head, чтобы не получить конфликт с другим SEO-решением.
Как проверить, что решение сработало
После внедрения не ограничивайтесь визуальной проверкой страницы. Нужно убедиться, что сервер реально отдаёт нужные сигналы.
- Откройте исходный код
/page/2/и найдитеnoindex, follow. - Проверьте, что каноникал указывает на первую страницу архива или остаётся логичным для вашей схемы.
- Убедитесь, что первая страница архива не получила случайный
noindex. - Посмотрите ответ страницы через
curl -Iи убедитесь, что нет редиректов или ошибок.
curl -I https://example.com/category/news/page/2/
Если хотите проверить именно HTML, используйте обычный просмотр исходника или инструменты разработчика. Важно увидеть итоговый <meta name="robots" ...> и <link rel="canonical" ...>, а не только настройки в админке.
Частые ошибки и как их исправить
Закрыли пагинацию через robots.txt
Это одна из самых частых ошибок. Когда URL запрещён в robots.txt, поисковик может не дойти до каноникала и не увидеть, что страница должна быть исключена корректно. Для дублей пагинации обычно лучше noindex, follow, а не жёсткий запрет обхода.
Поставили noindex на все архивы
Иногда в коде забывают проверить is_paged(), и под фильтр попадает первая страница рубрики или главная страница блога. Это уже вредно: вы сами убираете из индекса страницы, которые должны ранжироваться.
Конфликт каноникала и пагинации
Если каноникал на второй странице указывает на саму себя, а noindex отсутствует, поисковик может продолжать считать её отдельной страницей. Если каноникал всегда ведёт на первую страницу, но на второй странице есть уникальный контент, вы рискуете обесценить полезный URL. Здесь нужен баланс и проверка по конкретному типу архива.
Дублирующиеся мета-теги из темы и плагина
Когда тема и SEO-плагин одновременно пишут title, description и robots-мета, в коде может появиться каша. В таком случае оставьте один источник правды. Обычно это SEO-плагин, а кастомный код — только для точечной доработки.
Практические советы по безопасности и производительности
Если вы правите functions.php, делайте это в дочерней теме или через отдельный мини-плагин. Так вы не потеряете изменения после обновления темы. Перед правкой сохраните резервную копию и проверьте код на тестовой копии сайта.
Не добавляйте тяжёлые проверки в каждый запрос без необходимости. Для пагинации достаточно стандартных условных тегов WordPress: is_paged(), is_home(), is_archive(), is_search(). Они работают быстро и не требуют лишних запросов к базе.
Если сайт большой, после изменений полезно пересобрать карту сайта и проверить, не попали ли туда страницы, которые вы хотите исключить из индекса. Пагинация обычно не должна ломать sitemap, но ошибки в шаблонах и SEO-настройках иногда приводят к неожиданным включениям.
Короткий чек-лист перед публикацией изменений
- Проверили, какие именно архивы дают дубли.
- Убедились, что первая страница архива остаётся индексируемой.
- Добавили
noindex, followтолько для страниц пагинации. - Проверили canonical на
/page/2/и соседних страницах. - Сверили исходный код после обновления шаблона или плагина.
- Посмотрели отчёты Search Console через несколько дней после индексации.
Если задача стоит шире и вместе с пагинацией нужно чистить системные дубли, архивы и лишние страницы, имеет смысл сначала собрать карту технических проблем сайта, а уже потом решать, что закрывать кодом, а что — настройками SEO-плагина. В WordPress лучше убрать один источник дублей, чем потом лечить последствия в индексации.