На WordPress чаще всего индексируются не те страницы, которые вы хотели бы продвигать, а служебные: результаты поиска, архивы автора без контента, вложения, теги с пустыми лентами, страницы медиатеки, иногда служебные URL плагинов. Проблема не в самом факте их существования, а в том, что поисковик тратит обход на мусорные URL и может показывать в выдаче слабые или дублирующие страницы.
Ниже разберём, какие страницы реально стоит закрывать, чем отличается noindex от disallow, как это сделать через код и через плагин, и как проверить, что после правок сайт не потерял важные страницы из индекса.
Какие страницы WordPress обычно нужно закрывать
Не стоит закрывать всё подряд. Сначала разделите URL на две группы: полезные для поиска и технические. Полезные — это записи, страницы, категории, иногда теги, если они реально наполнены и ведут трафик. Технические — всё, что не должно конкурировать с основным контентом.
Типичные кандидаты на закрытие
- страницы внутреннего поиска вида
?s=; - архивы автора на сайтах с одним автором или без уникального контента в архивах;
- вложения-медиа страницы, если они не нужны как отдельные посадочные;
- пустые или почти пустые теги;
- служебные страницы пагинации архивов, если они уже закрываются отдельной логикой;
- страницы результатов фильтров и параметров, если они создают дубли;
- черновые таксономии и архивы, которые не несут самостоятельной ценности.
Если у вас уже есть статья про дубли пагинации, не смешивайте её с этой задачей. Здесь речь именно о служебных страницах, которые в принципе не должны попадать в индекс.
Диагностика: что именно индексируется сейчас
Перед правками проверьте, какие URL уже попали в индекс и откуда они берутся. Это можно сделать без специальных сервисов: в Google Search Console, через site: запросы и по логам обхода, если они доступны.
Что смотреть в первую очередь
- поиск по сайту в Google:
site:example.comи отдельные шаблоны URL; - страницы в Search Console в разделе индексации;
- наличие страниц вложений вида
/attachment/или медиа-страниц; - архивы автора, если сайт ведётся одним редактором;
- теги с нулевым или слабым содержанием;
- URL с параметрами, которые создают дубли.
Если в выдаче уже есть служебные страницы, одной правки robots.txt обычно недостаточно. Поисковик может продолжать хранить URL в индексе, если он уже был найден раньше. Для таких случаев нужен noindex или корректный canonical, а не только запрет обхода.
Что выбрать: noindex, canonical или robots.txt
Это ключевой момент. Ошибка здесь приводит к тому, что URL остаются в индексе или, наоборот, поисковик теряет доступ к странице, которую вы хотели бы переоценить.
| Подход | Когда использовать | Плюс | Минус |
|---|---|---|---|
noindex | Страница должна быть доступна роботу, но не нужна в выдаче | Поисковик видит страницу и может убрать её из индекса | Нужно, чтобы страница не была закрыта от обхода |
canonical | Есть дубль, который должен указывать на основную версию | Помогает склеивать похожие URL | Не всегда достаточно для откровенно мусорных страниц |
robots.txt | Нужно ограничить обход, а не удаление из индекса | Снижает нагрузку на обход | Не гарантирует удаление уже проиндексированного URL |
Практически: для внутренних поисков, архивов автора и страниц вложений чаще подходит noindex, follow. Для параметров и фильтров иногда нужен canonical на основную страницу. robots.txt используйте как дополнительный слой, но не как единственный способ убрать URL из выдачи.
Пошаговое решение через код темы или плагина
Если нужен контроль без лишних плагинов, можно добавить логику в functions.php дочерней темы или в небольшой mu-plugin. Так проще понять, что именно происходит, и не зависеть от интерфейса SEO-плагина.
1. Закрываем внутренний поиск и страницы вложений
<?php
add_action('wp_head', function () {
if (is_search() || is_attachment()) {
echo '<meta name="robots" content="noindex,follow" />' . "\n";
}
});
Этот вариант рабочий, но есть нюанс: если у вас уже подключён SEO-плагин, он может выводить свой robots meta. Тогда лучше не дублировать мета-теги вручную, а использовать фильтры плагина или его настройки. Иначе получите два разных robots-тега на одной странице.
2. Убираем автора из индекса на сайте с одним автором
<?php
add_filter('wpseo_robots', function ($robots) {
if (is_author()) {
return 'noindex,follow';
}
return $robots;
});
Фильтр выше относится к Yoast SEO. Если у вас другой SEO-плагин, ищите его собственный фильтр или настройку. Сам принцип одинаковый: архив автора должен отдавать noindex, если он не несёт самостоятельной ценности. На многоавторском сайте с сильными авторскими страницами это решение может быть лишним.
3. Настраиваем canonical для дублей с параметрами
<?php
add_filter('get_canonical_url', function ($canonical, $post) {
if (is_singular() && !empty($_GET['utm_source'])) {
return get_permalink($post);
}
return $canonical;
}, 10, 2);
Этот пример полезен только для страниц, где параметры не должны менять основную сущность документа. Если параметр реально меняет контент, canonical на чистый URL может быть неверным. Не используйте canonical как универсальную кнопку «склеить всё».
Как сделать это через SEO-плагин без кода
Если у вас уже стоит SEO-плагин, часть задач проще закрыть в интерфейсе. Это особенно удобно, когда нужно быстро убрать из индекса архивы, теги или медиа-страницы без правок темы.
Например, в плагинах уровня Yoast SEO или Rank Math обычно можно отдельно отключить индексацию архивов автора, тегов, дат и медиа-страниц. Смысл один: ищите настройки архивов и meta robots для таксономий. Не трогайте всё подряд, если теги у вас реально работают как посадочные страницы.
Если нужен более широкий набор технических настроек, иногда удобнее использовать Clearfy Pro: там есть инструменты для чистки сайта, отключения лишних архивов и технических дублей. Это не отменяет проверки результата, но экономит время на ручной настройке. Ссылка на продукт: Clearfy Pro.
Проверка результата после внедрения
После правок не ограничивайтесь просмотром кода страницы. Нужно проверить, что поисковик видит именно то, что вы ожидали.
- Откройте страницу в браузере и посмотрите исходный код: должен быть один корректный robots meta, если он нужен.
- Проверьте заголовок ответа и canonical через инструменты разработчика или
curl -I. - В Search Console отправьте URL на проверку и посмотрите, как робот видит страницу.
- Проверьте, не закрыли ли вы случайно важные архивы или записи.
- Через несколько дней повторно проверьте выдачу по
site:запросам.
Для быстрой проверки заголовков можно использовать такую команду:
curl -I https://example.com/?s=testВ ответе вы не увидите meta robots, потому что это HTML-метка, а не HTTP-заголовок. Но так можно проверить, не отдаёт ли страница неожиданный редирект, 404 или 200 там, где вы ожидали другое поведение. Для HTML-проверки удобнее открыть исходник страницы или использовать curl без -I и поискать строку с robots.
Частые ошибки и как их исправить
Закрыли страницу в robots.txt и ждёте удаления из индекса
Это частая ошибка. Если URL уже был проиндексирован, запрет обхода не всегда приводит к его исчезновению из выдачи. Сначала дайте странице noindex или корректный canonical, а потом уже ограничивайте обход, если это действительно нужно.
Поставили noindex на всё подряд
Иногда под раздачу попадают категории, записи или важные посадочные страницы. Это происходит, когда настройки копируют без анализа структуры сайта. Перед массовым закрытием составьте список URL-шаблонов и проверьте, какие из них реально должны ранжироваться.
Дублируете robots meta из темы и SEO-плагина
Если тема и плагин оба выводят мета-robots, поисковик может увидеть конфликтующие указания. Обычно это решается отключением одной из реализаций. В коде оставляйте только один источник правды.
Ставите canonical на главную страницу без логики
Так делают для страниц вложений, фильтров и параметров, но не всегда это корректно. Canonical должен указывать на наиболее близкую основную версию документа, а не просто на любую популярную страницу.
Чек-лист перед публикацией изменений
- Проверены все типы URL, которые должны быть закрыты.
- Для уже проиндексированных страниц выбран
noindex, а не толькоrobots.txt. - Не затронуты записи, категории и страницы, которые должны приносить трафик.
- Нет дублирующих robots meta от темы и плагина.
- Canonical не указывает на случайную страницу.
- После правок протестирован хотя бы один URL каждого типа.
Когда лучше не закрывать страницу
Не все архивы и таксономии нужно убирать из индекса. Если теговая страница содержит уникальную подборку материалов, имеет нормальный текст и реально получает переходы, её можно оставить открытой. То же касается авторских архивов на медиа-сайтах и блогах с несколькими сильными авторами.
Иначе вы можете потерять полезные входные страницы и ухудшить внутреннюю перелинковку. В технической оптимизации важнее не «закрыть побольше», а убрать только то, что действительно мешает индексации.
Если нужен более широкий контроль над техническими дублями, чисткой и SEO-настройками, имеет смысл собрать это в одном инструменте, а не размазывать по теме и нескольким плагинам. Но даже в этом случае проверка через Search Console и исходный код страницы остаётся обязательной.