Закрывать страницы от индексации приходится чаще, чем кажется. Интернет-магазин с тысячами страниц фильтров, дубли карточек товаров, личные кабинеты пользователей, версии сайта на время разработки — всё это попадает в индекс, если не принять мер. Результат: поисковики тратят краулинговый бюджет на мусорные страницы, а нужные страницы ранжируются хуже.
В этой статье — полный разбор методов закрытия от индексации, когда какой применять и как не допустить типичных ошибок, которые стоят трафика.
Зачем закрывать страницы от индексации
Большинство владельцев сайтов думают о закрытии от индексации только в двух случаях: «не хочу, чтобы сайт нашли» или «страница для служебного использования». На деле причин значительно больше — и они напрямую влияют на SEO.
- Дублированный контент. Страницы товара в нескольких категориях, версии с параметрами сортировки и пагинации, HTTP и HTTPS версии одновременно — поисковик видит несколько страниц с одинаковым содержанием и не знает, какую ранжировать. Вес размывается между дублями.
- Страницы фильтров в интернет-магазинах. Каталог с фильтрами по цвету, размеру, бренду и цене генерирует тысячи уникальных URL с минимальным уникальным контентом. Яндекс и Google называют такие страницы «тонким контентом» — они разбавляют качество сайта в глазах поисковика.
- Служебные разделы. Личный кабинет, корзина, страницы оформления заказа, результаты поиска по сайту — индексировать их бессмысленно и вредно.
- Сайт на период разработки. Разработчики часто закрывают тестовые сайты через robots.txt. Проблема — если забыть снять запрет перед запуском. Это одна из самых болезненных SEO-ошибок: сайт запустили, но поисковики не могут его проиндексировать месяцами.
Авторский: Грамотное закрытие от индексации — это не «спрятать страницы», а хирургическая работа с краулинговым бюджетом. Особенно критично для крупных сайтов, где Googlebot обходит ограниченное число страниц в день.
Способы закрыть страницу от индексации
| Метод | Что делает | Блокирует обход | Блокирует индексацию | Когда применять |
|---|---|---|---|---|
| robots.txt Disallow | Запрещает роботу обходить страницу | Да | Не гарантирует | Разделы, которые не нужно обходить совсем |
| Meta noindex | Указывает не добавлять страницу в индекс | Нет | Да | Страницы, которые можно обходить, но не нужно индексировать |
| X-Robots-Tag | То же, что noindex, но через HTTP-заголовок | Нет | Да | PDF, изображения, файлы без HTML |
| Canonical | Указывает основную версию страницы при дублях | Нет | Не всегда | Дублированный контент, страницы с параметрами |
| Пароль / авторизация | Закрывает доступ к разделу полностью | Да | Да | Личные кабинеты, закрытые разделы |
Как закрыть сайт через robots.txt
Robots.txt — текстовый файл в корне сайта, который даёт инструкции поисковым роботам: что можно обходить, а что нет. Файл читается роботом перед тем, как он начинает сканировать сайт.
Синтаксис запрета индексации в robots.txt
Базовые директивы:
User-agent— к какому роботу относится правило.*— все роботы,Googlebot— только Google,Yandex— только Яндекс.Disallow— запрет на обход указанного URL или раздела.Allow— явное разрешение (используется для исключений внутри запрещённого раздела).
Запретить индексацию всего сайта (для всех роботов):
User-agent: * Disallow: /
- Конкретный раздел:
User-agent: * Disallow: /admin/ Disallow: /cabinet/ Disallow: /search/
- Страницы с параметрами (фильтры):
User-agent: * Disallow: /*?*
- Запрет только для Яндекса, разрешить Google:
User-agent: Yandex Disallow: /promo/ User-agent: Googlebot Allow: /promo/
- Запрет раздела с исключением одной страницы:
User-agent: * Disallow: /catalog/ Allow: /catalog/main/
Важное ограничение robots.txt
Robots.txt запрещает обход, но не гарантирует исключение из индекса. Если на закрытую страницу ведут внешние ссылки, Google может добавить её URL в индекс — без содержимого, только на основании самого факта существования ссылки. Такая страница появится в выдаче с пометкой «Описание для этого результата недоступно». Для гарантированного исключения из индекса используйте meta noindex.
Тег noindex — когда robots.txt не подходит

Мета-тег noindex даёт роботу прямую инструкцию: страницу можно обходить, но в индекс добавлять не нужно. Это важное отличие от robots.txt: робот читает страницу, видит тег, исключает из индекса.
Тег добавляется в секцию <head> страницы:
<meta name="robots" content="noindex">
Запрет для конкретного поисковика:
<meta name="googlebot" content="noindex"> <meta name="yandex" content="noindex">
Комбинированный запрет — не индексировать и не переходить по ссылкам со страницы:
<meta name="robots" content="noindex, nofollow">
X-Robots-Tag: noindex для не-HTML файлов
PDF-документы, изображения и другие файлы не имеют HTML-разметки — в них нельзя добавить мета-тег. Для них используется HTTP-заголовок X-Robots-Tag. Настраивается на уровне сервера (Apache или Nginx).
Пример для Apache (.htaccess) — запрет индексации всех PDF:
<FilesMatch "\.pdf$"> Header set X-Robots-Tag "noindex" </FilesMatch>
Авторский вывод: Если страница закрыта в robots.txt, но не имеет noindex — вы запрещаете роботу читать тег noindex. Это классическая ловушка: страница частично выпадает из обхода, но не гарантированно из индекса. Правило: robots.txt — для экономии краулинга, noindex — для гарантированного исключения. Лучшее решение для служебных страниц — оба метода одновременно.
Атрибут nofollow и тег canonical
Rel nofollow: закрыть ссылку, а не страницу
Атрибут rel="nofollow" добавляется не к странице, а к конкретной ссылке. Он сообщает поисковику: «по этой ссылке не передавай вес, не следуй ей при определении авторитетности». Страницу при этом никто не закрывает — она остаётся доступной и может индексироваться.
<a href="https://example.com/page" rel="nofollow">Текст ссылки</a>
Когда применять nofollow: ссылки на рекламные материалы, партнёрские ссылки, пользовательский контент (комментарии, форумы), ссылки на внешние сайты, которым вы не доверяете. Яндекс и Google трактуют nofollow как «подсказку», а не жёсткое правило — могут следовать ссылке по своему усмотрению.
Canonical: решение проблемы дублей
Тег canonical указывает поисковику «каноническую» — основную — версию страницы при наличии дублей. Используется, когда удалить дубли технически невозможно (например, один товар в нескольких категориях).
<link rel="canonical" href="https://example.com/catalog/product-name/" />
Этот тег добавляется на все дублирующие страницы и указывает на основную. Поисковик должен передать вес каноническому URL и исключить дубли из ранжирования. Важное уточнение: canonical — рекомендация, не директива. Google учитывает его примерно в 80% случаев. Если дубли очень похожи по содержанию — следует, если нет — может проигнорировать.
Как проверить запрет индексации

После настройки robots.txt или noindex важно убедиться, что всё работает корректно. Несколько инструментов для проверки.
- Тестер robots.txt в Google Search Console. Раздел «Инструменты» → «Тестирование файла robots.txt». Позволяет проверить, какие страницы закрыты для Googlebot, и увидеть ошибки синтаксиса.
- Яндекс Вебмастер. Раздел «Инструменты» → «Анализ robots.txt». Аналогичная функция для проверки файла с точки зрения Яндекс-бота.
- Оператор site: в поиске. Введите
site:yoursite.com/раздел/в Google или Яндексе. Если страницы из закрытого раздела всё ещё появляются — индексация ещё не применена или метод не работает. - Заголовки ответа сервера. Для проверки X-Robots-Tag используйте curl:
curl -I https://yoursite.com/page.pdf— в ответе увидите заголовки, включая X-Robots-Tag. - Отчёт об индексировании в GSC. Страницы с noindex появятся в отчёте «Покрытие» со статусом «Исключено: страница с тегом noindex». Это подтверждение, что Google прочёл тег.
Типичные ошибки при закрытии от индексации
- Закрыть через robots.txt и ждать удаления из индекса. Robots.txt только запрещает новые обходы. Страницы, уже находящиеся в индексе, не исчезнут автоматически. Для удаления из индекса нужно: добавить noindex + дождаться, пока робот обойдёт страницу и прочтёт тег, или использовать инструмент удаления URL в Google Search Console для срочного исключения.
- Закрыть robots.txt и поставить noindex одновременно — неправильно. Классическое противоречие: robots.txt запрещает обход, поэтому робот не может прочитать noindex на странице. Google прямо указывает: если нужен noindex — страница должна быть доступна для обхода, то есть не закрыта в robots.txt.
- Забыть снять запрет после разработки. Одна строка
Disallow: /в robots.txt на тестовом сервере, перенесённая вместе с файлами на продакшн, — и сайт месяцами не индексируется. Проверка robots.txt должна быть обязательным пунктом чеклиста запуска любого сайта. - Закрыть CSS и JS-файлы. Некоторые разработчики закрывают от обхода папки со стилями и скриптами «для безопасности». Google не сможет корректно отрендерить страницу без CSS и JS — и может занизить её в выдаче или некорректно проиндексировать содержимое.
- Использовать nofollow вместо noindex. Nofollow не убирает страницу из индекса — только влияет на передачу ссылочного веса. Это разные инструменты для разных задач.
Закрытие от индексации по типам страниц: шпаргалка
Не всегда очевидно, какой метод применить к конкретному типу страниц. Систематизированный ответ:
- Личный кабинет, корзина, оформление заказа — robots.txt Disallow + авторизация. Эти страницы не должны быть доступны роботу вообще.
- Страницы фильтров (/catalog/?color=red) — robots.txt Disallow для URL с параметрами (
Disallow: /*?*) или canonical на основную страницу категории. - Страницы пагинации (/page/2/, /page/3/) — для Google: canonical на первую страницу или noindex. Для Яндекса: noindex рекомендуется только если контент дублируется. Если страницы уникальны — лучше индексировать.
- Теги и архивы в WordPress — noindex через Yoast SEO или Rank Math, если нет уникального контента.
- Версия сайта на поддомене разработки (dev.site.ru) — robots.txt Disallow: / + закрытый доступ по IP или паролю.
- Страницы благодарности после формы (thank-you) — noindex. В индексе они бесполезны и могут искажать данные в аналитике.
- PDF и документы — X-Robots-Tag: noindex на уровне сервера, если документы не предназначены для поиска.
- Дубли из-за www/без www или http/https — 301-редирект на основную версию. Это не закрытие от индексации, а устранение причины дублирования.
Авторский: Хорошая архитектура сайта снижает необходимость в закрытии от индексации. Большинство проблем с дублями и мусорными страницами решаются на уровне проектирования URL-структуры и шаблонов — до того, как страницы попадают в индекс.
Частые вопросы

Как быстро страница исчезнет из индекса после добавления noindex?
Зависит от частоты обхода страницы роботом. Активно индексируемые страницы крупных сайтов обновляются в течение нескольких дней. Страницы небольших сайтов могут ждать несколько недель. Для срочного исключения — используйте инструмент удаления URL в Google Search Console (временное исключение на 6 месяцев) или аналогичный инструмент в Яндекс Вебмастере.
Чем отличается noindex от nofollow?
Noindex запрещает добавлять страницу в поисковый индекс — она не будет показываться в результатах поиска. Nofollow — атрибут ссылки, указывающий не передавать ссылочный вес и не использовать ссылку при определении авторитетности. Noindex применяется к странице, nofollow — к конкретной ссылке на неё. Страница с nofollow-ссылками на неё может спокойно индексироваться.
Можно ли закрыть от индексации только часть текста на странице?
Для Яндекса — да, с помощью специального тега. Содержимое между <!--noindex--> и <!--/noindex--> Яндекс не будет индексировать, но остальной контент страницы — будет. Google этот тег не поддерживает. Распространённый сценарий использования: навигационные блоки, повторяющиеся на всех страницах, счётчики, рекламные блоки.
Как закрыть сайт от индексации в WordPress?
В WordPress есть встроенная опция: Настройки → Чтение → «Попросить поисковые системы не индексировать сайт». Это добавляет мета-тег noindex на все страницы. Важно убедиться, что галочка снята на боевом сайте. Для тонкой настройки (закрыть конкретные типы страниц) используйте плагины Yoast SEO или Rank Math — они позволяют управлять noindex для каждого типа записей, архивов, тегов и категорий по отдельности.
Robots.txt закрывает сайт от всех роботов или только от поисковиков?
Robots.txt — рекомендация, а не техническое ограничение. Добросовестные роботы (Google, Яндекс, Bing) соблюдают его. Недобросовестные сканеры, парсеры данных и боты-спамеры — игнорируют. Для защиты от нежелательного парсинга используйте авторизацию, ограничение по IP или WAF (Web Application Firewall), а не только robots.txt.
Комментарии скоро откроются. А пока — пишите нам в Telegram-канал.