Скачать приложение
Всё SEO продвижение Digital Маркетинг Разработка сайтов Контекстная реклама Соцсети Дизайн Бизнес Мессенджеры Нейросети Менеджмент Новинки Психология Экономика
SEO продвижение

Как закрыть сайт от индексации: robots.txt, noindex и другие методы

admin
13 июля 2025 · 2 минут · 1

Закрывать страницы от индексации приходится чаще, чем кажется. Интернет-магазин с тысячами страниц фильтров, дубли карточек товаров, личные кабинеты пользователей, версии сайта на время разработки — всё это попадает в индекс, если не принять мер. Результат: поисковики тратят краулинговый бюджет на мусорные страницы, а нужные страницы ранжируются хуже.

В этой статье — полный разбор методов закрытия от индексации, когда какой применять и как не допустить типичных ошибок, которые стоят трафика.

Зачем закрывать страницы от индексации

Большинство владельцев сайтов думают о закрытии от индексации только в двух случаях: «не хочу, чтобы сайт нашли» или «страница для служебного использования». На деле причин значительно больше — и они напрямую влияют на SEO.

  • Дублированный контент. Страницы товара в нескольких категориях, версии с параметрами сортировки и пагинации, HTTP и HTTPS версии одновременно — поисковик видит несколько страниц с одинаковым содержанием и не знает, какую ранжировать. Вес размывается между дублями.
  • Страницы фильтров в интернет-магазинах. Каталог с фильтрами по цвету, размеру, бренду и цене генерирует тысячи уникальных URL с минимальным уникальным контентом. Яндекс и Google называют такие страницы «тонким контентом» — они разбавляют качество сайта в глазах поисковика.
  • Служебные разделы. Личный кабинет, корзина, страницы оформления заказа, результаты поиска по сайту — индексировать их бессмысленно и вредно.
  • Сайт на период разработки. Разработчики часто закрывают тестовые сайты через robots.txt. Проблема — если забыть снять запрет перед запуском. Это одна из самых болезненных SEO-ошибок: сайт запустили, но поисковики не могут его проиндексировать месяцами.

Авторский: Грамотное закрытие от индексации — это не «спрятать страницы», а хирургическая работа с краулинговым бюджетом. Особенно критично для крупных сайтов, где Googlebot обходит ограниченное число страниц в день.

Способы закрыть страницу от индексации

Метод Что делает Блокирует обход Блокирует индексацию Когда применять
robots.txt Disallow Запрещает роботу обходить страницу Да Не гарантирует Разделы, которые не нужно обходить совсем
Meta noindex Указывает не добавлять страницу в индекс Нет Да Страницы, которые можно обходить, но не нужно индексировать
X-Robots-Tag То же, что noindex, но через HTTP-заголовок Нет Да PDF, изображения, файлы без HTML
Canonical Указывает основную версию страницы при дублях Нет Не всегда Дублированный контент, страницы с параметрами
Пароль / авторизация Закрывает доступ к разделу полностью Да Да Личные кабинеты, закрытые разделы

Как закрыть сайт через robots.txt

Robots.txt — текстовый файл в корне сайта, который даёт инструкции поисковым роботам: что можно обходить, а что нет. Файл читается роботом перед тем, как он начинает сканировать сайт.

Синтаксис запрета индексации в robots.txt

Базовые директивы:

  • User-agent — к какому роботу относится правило. * — все роботы, Googlebot — только Google, Yandex — только Яндекс.
  • Disallow — запрет на обход указанного URL или раздела.
  • Allow — явное разрешение (используется для исключений внутри запрещённого раздела).

Запретить индексацию всего сайта (для всех роботов):

User-agent: *
Disallow: /
  • Конкретный раздел:
User-agent: *
Disallow: /admin/
Disallow: /cabinet/
Disallow: /search/
  • Страницы с параметрами (фильтры):
User-agent: *
Disallow: /*?*
  • Запрет только для Яндекса, разрешить Google:
User-agent: Yandex
Disallow: /promo/

User-agent: Googlebot
Allow: /promo/
  • Запрет раздела с исключением одной страницы:
User-agent: *
Disallow: /catalog/
Allow: /catalog/main/

Важное ограничение robots.txt

Robots.txt запрещает обход, но не гарантирует исключение из индекса. Если на закрытую страницу ведут внешние ссылки, Google может добавить её URL в индекс — без содержимого, только на основании самого факта существования ссылки. Такая страница появится в выдаче с пометкой «Описание для этого результата недоступно». Для гарантированного исключения из индекса используйте meta noindex.

Тег noindex — когда robots.txt не подходит

Meta-teg-noindex

Мета-тег noindex даёт роботу прямую инструкцию: страницу можно обходить, но в индекс добавлять не нужно. Это важное отличие от robots.txt: робот читает страницу, видит тег, исключает из индекса.

Тег добавляется в секцию <head> страницы:

<meta name="robots" content="noindex">

Запрет для конкретного поисковика:

<meta name="googlebot" content="noindex">
<meta name="yandex" content="noindex">

Комбинированный запрет — не индексировать и не переходить по ссылкам со страницы:

<meta name="robots" content="noindex, nofollow">

X-Robots-Tag: noindex для не-HTML файлов

PDF-документы, изображения и другие файлы не имеют HTML-разметки — в них нельзя добавить мета-тег. Для них используется HTTP-заголовок X-Robots-Tag. Настраивается на уровне сервера (Apache или Nginx).

Пример для Apache (.htaccess) — запрет индексации всех PDF:

<FilesMatch "\.pdf$">
  Header set X-Robots-Tag "noindex"
</FilesMatch>

Авторский вывод: Если страница закрыта в robots.txt, но не имеет noindex — вы запрещаете роботу читать тег noindex. Это классическая ловушка: страница частично выпадает из обхода, но не гарантированно из индекса. Правило: robots.txt — для экономии краулинга, noindex — для гарантированного исключения. Лучшее решение для служебных страниц — оба метода одновременно.

Атрибут nofollow и тег canonical

Rel nofollow: закрыть ссылку, а не страницу

Атрибут rel="nofollow" добавляется не к странице, а к конкретной ссылке. Он сообщает поисковику: «по этой ссылке не передавай вес, не следуй ей при определении авторитетности». Страницу при этом никто не закрывает — она остаётся доступной и может индексироваться.

<a href="https://example.com/page" rel="nofollow">Текст ссылки</a>

Когда применять nofollow: ссылки на рекламные материалы, партнёрские ссылки, пользовательский контент (комментарии, форумы), ссылки на внешние сайты, которым вы не доверяете. Яндекс и Google трактуют nofollow как «подсказку», а не жёсткое правило — могут следовать ссылке по своему усмотрению.

Canonical: решение проблемы дублей

Тег canonical указывает поисковику «каноническую» — основную — версию страницы при наличии дублей. Используется, когда удалить дубли технически невозможно (например, один товар в нескольких категориях).

<link rel="canonical" href="https://example.com/catalog/product-name/" />

Этот тег добавляется на все дублирующие страницы и указывает на основную. Поисковик должен передать вес каноническому URL и исключить дубли из ранжирования. Важное уточнение: canonical — рекомендация, не директива. Google учитывает его примерно в 80% случаев. Если дубли очень похожи по содержанию — следует, если нет — может проигнорировать.

Как проверить запрет индексации

После настройки robots.txt или noindex важно убедиться, что всё работает корректно. Несколько инструментов для проверки.

  • Тестер robots.txt в Google Search Console. Раздел «Инструменты» → «Тестирование файла robots.txt». Позволяет проверить, какие страницы закрыты для Googlebot, и увидеть ошибки синтаксиса.
  • Яндекс Вебмастер. Раздел «Инструменты» → «Анализ robots.txt». Аналогичная функция для проверки файла с точки зрения Яндекс-бота.
  • Оператор site: в поиске. Введите site:yoursite.com/раздел/ в Google или Яндексе. Если страницы из закрытого раздела всё ещё появляются — индексация ещё не применена или метод не работает.
  • Заголовки ответа сервера. Для проверки X-Robots-Tag используйте curl: curl -I https://yoursite.com/page.pdf — в ответе увидите заголовки, включая X-Robots-Tag.
  • Отчёт об индексировании в GSC. Страницы с noindex появятся в отчёте «Покрытие» со статусом «Исключено: страница с тегом noindex». Это подтверждение, что Google прочёл тег.

Типичные ошибки при закрытии от индексации

  • Закрыть через robots.txt и ждать удаления из индекса. Robots.txt только запрещает новые обходы. Страницы, уже находящиеся в индексе, не исчезнут автоматически. Для удаления из индекса нужно: добавить noindex + дождаться, пока робот обойдёт страницу и прочтёт тег, или использовать инструмент удаления URL в Google Search Console для срочного исключения.
  • Закрыть robots.txt и поставить noindex одновременно — неправильно. Классическое противоречие: robots.txt запрещает обход, поэтому робот не может прочитать noindex на странице. Google прямо указывает: если нужен noindex — страница должна быть доступна для обхода, то есть не закрыта в robots.txt.
  • Забыть снять запрет после разработки. Одна строка Disallow: / в robots.txt на тестовом сервере, перенесённая вместе с файлами на продакшн, — и сайт месяцами не индексируется. Проверка robots.txt должна быть обязательным пунктом чеклиста запуска любого сайта.
  • Закрыть CSS и JS-файлы. Некоторые разработчики закрывают от обхода папки со стилями и скриптами «для безопасности». Google не сможет корректно отрендерить страницу без CSS и JS — и может занизить её в выдаче или некорректно проиндексировать содержимое.
  • Использовать nofollow вместо noindex. Nofollow не убирает страницу из индекса — только влияет на передачу ссылочного веса. Это разные инструменты для разных задач.

Закрытие от индексации по типам страниц: шпаргалка

Не всегда очевидно, какой метод применить к конкретному типу страниц. Систематизированный ответ:

  • Личный кабинет, корзина, оформление заказа — robots.txt Disallow + авторизация. Эти страницы не должны быть доступны роботу вообще.
  • Страницы фильтров (/catalog/?color=red) — robots.txt Disallow для URL с параметрами (Disallow: /*?*) или canonical на основную страницу категории.
  • Страницы пагинации (/page/2/, /page/3/) — для Google: canonical на первую страницу или noindex. Для Яндекса: noindex рекомендуется только если контент дублируется. Если страницы уникальны — лучше индексировать.
  • Теги и архивы в WordPress — noindex через Yoast SEO или Rank Math, если нет уникального контента.
  • Версия сайта на поддомене разработки (dev.site.ru) — robots.txt Disallow: / + закрытый доступ по IP или паролю.
  • Страницы благодарности после формы (thank-you) — noindex. В индексе они бесполезны и могут искажать данные в аналитике.
  • PDF и документы — X-Robots-Tag: noindex на уровне сервера, если документы не предназначены для поиска.
  • Дубли из-за www/без www или http/https — 301-редирект на основную версию. Это не закрытие от индексации, а устранение причины дублирования.

Авторский: Хорошая архитектура сайта снижает необходимость в закрытии от индексации. Большинство проблем с дублями и мусорными страницами решаются на уровне проектирования URL-структуры и шаблонов — до того, как страницы попадают в индекс.

Частые вопросы

Как быстро страница исчезнет из индекса после добавления noindex?

Зависит от частоты обхода страницы роботом. Активно индексируемые страницы крупных сайтов обновляются в течение нескольких дней. Страницы небольших сайтов могут ждать несколько недель. Для срочного исключения — используйте инструмент удаления URL в Google Search Console (временное исключение на 6 месяцев) или аналогичный инструмент в Яндекс Вебмастере.

Чем отличается noindex от nofollow?

Noindex запрещает добавлять страницу в поисковый индекс — она не будет показываться в результатах поиска. Nofollow — атрибут ссылки, указывающий не передавать ссылочный вес и не использовать ссылку при определении авторитетности. Noindex применяется к странице, nofollow — к конкретной ссылке на неё. Страница с nofollow-ссылками на неё может спокойно индексироваться.

Можно ли закрыть от индексации только часть текста на странице?

Для Яндекса — да, с помощью специального тега. Содержимое между <!--noindex--> и <!--/noindex--> Яндекс не будет индексировать, но остальной контент страницы — будет. Google этот тег не поддерживает. Распространённый сценарий использования: навигационные блоки, повторяющиеся на всех страницах, счётчики, рекламные блоки.

Как закрыть сайт от индексации в WordPress?

В WordPress есть встроенная опция: Настройки → Чтение → «Попросить поисковые системы не индексировать сайт». Это добавляет мета-тег noindex на все страницы. Важно убедиться, что галочка снята на боевом сайте. Для тонкой настройки (закрыть конкретные типы страниц) используйте плагины Yoast SEO или Rank Math — они позволяют управлять noindex для каждого типа записей, архивов, тегов и категорий по отдельности.

Robots.txt закрывает сайт от всех роботов или только от поисковиков?

Robots.txt — рекомендация, а не техническое ограничение. Добросовестные роботы (Google, Яндекс, Bing) соблюдают его. Недобросовестные сканеры, парсеры данных и боты-спамеры — игнорируют. Для защиты от нежелательного парсинга используйте авторизацию, ограничение по IP или WAF (Web Application Firewall), а не только robots.txt.

0

Комментарии скоро откроются. А пока — пишите нам в Telegram-канал.