Как настроить robots.txt в WordPress для закрытия технических страниц

Если в индексе появляются служебные URL, дубли архивов, страницы поиска или внутренние параметры, проблема часто не в «плохом SEO», а в том, что поисковик слишком свободно ходит по техническим разделам сайта. В WordPress это обычно лечится не одним правилом, а связкой: robots.txt, мета-тегами noindex и аккуратной настройкой самих шаблонов.

Ниже — рабочий сценарий: что именно закрывать, где не переборщить и как проверить, что поисковые роботы действительно перестали тратить краулинговый бюджет на мусорные страницы.

Какие страницы WordPress обычно стоит закрывать

Не нужно пытаться закрыть всё подряд. robots.txt полезен там, где есть технические URL, не несущие ценности для поиска и часто создающие дубли.

  • страницы поиска по сайту вида ?s=;
  • служебные архивы, если они не нужны в выдаче;
  • URL с параметрами сортировки и фильтрации;
  • служебные каталоги плагинов и тем, если они доступны по прямым адресам;
  • админские и системные разделы, которые и так не должны индексироваться.

При этом важно понимать ограничение: robots.txt не удаляет страницу из индекса, если она уже известна поисковику. Для удаления из выдачи нужен noindex или корректный редирект/404, а не только запрет обхода.

Диагностика проблемы: что именно индексируется лишнее

Перед правкой файла проверьте, какие URL реально попали в поиск. Для этого удобно использовать:

  • отчёт по страницам в Google Search Console или Яндекс.Вебмастере;
  • поиск по оператору site:example.com с нужным шаблоном URL;
  • лог сервера, если нужно увидеть, что бот чаще всего запрашивает;
  • проверку исходного кода страниц на наличие meta robots.

Типичный признак проблемы — в индексе есть страницы поиска, архивы тегов с пустым или слабым содержанием, а также URL с параметрами вроде ?orderby=, ?replytocom= или внутренние страницы пагинации, которые не должны конкурировать с основным контентом.

Когда robots.txt не поможет

Если страница уже в индексе и на ней есть ссылки с других страниц, одного запрета в robots.txt недостаточно. Поисковик может оставить URL в базе как «запрещённый к обходу». В таких случаях лучше:

  • добавить noindex, follow на сам шаблон;
  • убрать внутренние ссылки на мусорные URL;
  • при необходимости вернуть 404 или 410 для неактуальных страниц;
  • использовать редирект, если URL имеет замену.

Пошаговая настройка robots.txt в WordPress

В WordPress файл robots.txt можно отдать виртуально через CMS или создать физический файл в корне сайта. Для большинства проектов достаточно виртуального варианта, если сервер не переопределяет его статическим файлом.

Шаг 1. Добавьте базовые правила

Ниже пример аккуратного robots.txt для обычного сайта на WordPress. Он не закрывает важные публичные разделы и не мешает поисковику индексировать контент.

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-login.php
Disallow: /search/
Disallow: /*?s=
Disallow: /*?replytocom=
Disallow: /*?orderby=
Disallow: /*?filter=

Sitemap: https://example.com/sitemap_index.xml

Здесь есть важный момент: правила с параметрами работают не во всех поисковых системах одинаково. Для Google это обычно полезно, но не стоит считать такой запрет универсальным решением для всех дублей. Если фильтры и сортировки создают много мусора, лучше дополнительно закрывать их на уровне шаблона.

Шаг 2. Закройте служебные страницы не только robots.txt, но и noindex

Для страниц поиска и архивов, которые уже отдаются как HTML, безопаснее добавить noindex. В WordPress это можно сделать через фильтр wp_robots в теме или плагине.

<?php
add_filter('wp_robots', function ($robots) {
    if (is_search() || is_tag() || is_author()) {
        $robots['noindex'] = true;
        $robots['follow'] = true;
    }

    return $robots;
});

Этот подход полезен, если вы хотите оставить страницы доступными для пользователей, но не видеть их в поиске. Для архивов тегов и авторов решение зависит от структуры сайта: на новостном проекте архивы могут быть полезны, а на небольшом блоге — только плодить дубли.

Шаг 3. Проверьте, не конфликтует ли robots.txt с SEO-плагином

Если у вас установлен SEO-плагин, он может генерировать собственный robots.txt или добавлять мета-правила. Важно не дублировать запреты в двух местах без необходимости. Иначе потом сложно понять, какое правило реально сработало.

ПодходКогда использоватьМинус
Только robots.txtДля явных технических URL, которые не должны обходитьсяНе удаляет уже проиндексированные страницы
robots.txt + noindexДля HTML-страниц поиска, архивов, фильтровНужно править шаблоны или фильтры темы
Редирект/404/410Для неактуальных или ошибочных URLТребует аккуратной проверки ссылок и логики сайта

Как проверить, что настройка сработала

После правки не ограничивайтесь просмотром файла в браузере. Нужна проверка на уровне ответа сервера и индексации.

  • Откройте /robots.txt и убедитесь, что файл отдается без ошибок.
  • Проверьте, не перекрывает ли его физический файл в корне сайта.
  • В Search Console отправьте проверку конкретного URL и посмотрите, разрешён ли обход.
  • Убедитесь, что на страницах поиска и архивов появился noindex, если вы его добавляли.
  • Через несколько дней проверьте, уменьшилось ли число мусорных URL в отчёте по страницам.

Если нужно быстро посмотреть заголовки ответа, используйте curl:

curl -I https://example.com/search/test/
curl -I https://example.com/robots.txt

В первом случае вы увидите, отдается ли страница как обычный HTML и есть ли нужные заголовки. Во втором — что именно доступно поисковику для чтения.

Частые ошибки и как их исправить

Закрыли слишком много

Самая частая ошибка — запретить в robots.txt всё, что похоже на архивы или параметры, а потом обнаружить, что бот не может нормально добраться до полезных разделов. Если закрыть CSS, JS или важные публичные страницы, можно получить проблемы с рендерингом и индексацией.

Исправление простое: уберите лишние Disallow, оставьте только технические URL и проверьте, не блокируются ли ресурсы темы и плагинов.

Путают robots.txt и noindex

robots.txt запрещает обход, а noindex просит не индексировать страницу. Это разные задачи. Если страница уже в поиске, сначала добейтесь, чтобы бот мог её увидеть и получить noindex, иначе удаление может затянуться.

Используют правила с параметрами без проверки

Шаблоны вроде Disallow: /*?s= могут работать не так, как ожидается, если сайт генерирует нестандартные URL или если поисковик интерпретирует правило иначе. После внедрения обязательно проверьте несколько реальных адресов из логов и из Search Console.

Оставляют дубли в навигации

Даже идеальный robots.txt не спасёт, если внутренняя перелинковка ведёт на десятки дублей. Уберите ссылки на мусорные фильтры, отключите лишние архивы в теме, а при необходимости настройте канонические URL.

Практические советы по безопасности и производительности

Служебные страницы и параметры часто создают лишнюю нагрузку не только на индексацию, но и на сервер. Если на сайте есть фильтры, поиск и сортировки, они могут генерировать много однотипных запросов. В таком случае полезно:

  • ограничить индексацию параметров на уровне шаблонов;
  • не давать поисковикам ходить по бесконечным комбинациям фильтров;
  • проверить, не создаёт ли тема отдельные архивы без контента;
  • убрать лишние ссылки на внутренний поиск из футера и меню, если он не нужен в выдаче.

Если вы используете плагин для технической чистки сайта, например Clearfy Pro, его имеет смысл рассматривать как инструмент для отключения дублей и лишних служебных сущностей, но не как замену ручной проверке. Автоматические настройки стоит сверять с реальной структурой сайта, иначе можно закрыть полезные разделы вместе с мусором.

Мини-чек-лист перед публикацией изменений

  • Проверен текущий robots.txt и нет конфликта с физическим файлом.
  • Служебные URL закрыты точечно, а не «на всякий случай».
  • Для HTML-страниц с дублями добавлен noindex, если это нужно.
  • Внутренние ссылки на мусорные URL убраны или сокращены.
  • Проверка в Search Console показывает ожидаемое поведение.
  • Через несколько дней отслеживается динамика в отчётах по страницам и обходу.

Если задача — не просто «спрятать что-то от робота», а навести порядок в индексации WordPress, начинайте с карты URL: что должно быть в поиске, что должно быть доступно только пользователю, а что вообще не должно существовать как отдельная страница. Тогда robots.txt становится не костылём, а частью нормальной технической настройки сайта.

Как удалить удалённых пользователей WordPress без возможности восстановления
06.12.2025
WooCommerce: как автоматически удалять товар после покупки
10.05.2026
Как использовать WPRemark для повышения вовлечённости пользователей в WordPress
14.01.2026
Как добавить дополнительное поле в форму регистрации WordPress
22.12.2025
WooCommerce: как автоматически удалять неоплаченные заказы через заданное время
08.08.2026