Адрес

г. Москва
Проспект Мира 101 с1

Файл robots.txt: что это такое и зачем он нужен

  • 08.07.2026
  • 34

Файл robots.txt — это текстовый файл в корне сайта, который содержит правила обхода для поисковых роботов. Он сообщает роботам, какие разделы можно сканировать, а какие не нужно обходить. Обычно файл доступен по адресу вида https://site.ru/robots.txt.

Простыми словами, robots.txt — это инструкция для краулеров. Он не управляет ранжированием напрямую и не является надёжным способом скрыть конфиденциальную информацию, но помогает управлять сканированием сайта и снижать нагрузку на поисковых роботов.

Что можно указать в robots.txt

  • User-agent. Указывает, к какому роботу относятся правила.
  • Disallow. Запрещает обход указанного раздела или URL-шаблона.
  • Allow. Разрешает обход внутри закрытого раздела.
  • Sitemap. Указывает путь к карте сайта.
  • Crawl-delay. Ограничивает частоту обращений для некоторых роботов, но поддерживается не всеми.
  • Clean-param. Используется Яндексом для обработки параметров URL.

Пример robots.txt

HTML

User-agent: *
Disallow: /admin/
Disallow: /search/
Allow: /upload/
Sitemap: https://site.ru/sitemap.xml

В этом примере всем роботам запрещён обход административного раздела и поиска по сайту, разрешён доступ к папке upload и указан sitemap.xml.

Robots.txt и индексация

Важно понимать: robots.txt управляет сканированием, а не гарантированным удалением страницы из индекса. Если URL закрыт в robots.txt, поисковый робот может не зайти на страницу и не увидеть meta noindex. При этом URL может оставаться в индексе, если на него есть внешние или внутренние ссылки.

Если нужно именно убрать страницу из поиска, чаще используют noindex, удаление URL, 404/410 или другие методы по ситуации. Robots.txt нужен прежде всего для контроля обхода.

Что обычно закрывают в robots.txt

  • административные разделы;
  • служебные URL;
  • результаты поиска по сайту;
  • корзину и оформление заказа;
  • личный кабинет;
  • технические параметры;
  • страницы сортировок и слабых фильтров;
  • дубли, которые не нужно сканировать;
  • тестовые разделы, если они не должны обходиться.

Что нельзя закрывать без проверки

  • важные категории;
  • карточки товаров;
  • страницы услуг;
  • CSS и JavaScript, нужные для рендеринга;
  • изображения, если они важны для поиска;
  • sitemap.xml;
  • разделы, которые должны получать органический трафик.

Частые ошибки robots.txt

  • случайно закрыт весь сайт через Disallow: /;
  • закрыты CSS и JS;
  • закрыты важные посадочные страницы;
  • robots.txt отдаёт 404, 403 или 500;
  • в sitemap указан неактуальный адрес;
  • путают robots.txt и noindex;
  • пытаются скрыть секретные данные через robots.txt;
  • правила написаны для одного робота, а ожидается действие для всех;
  • после редизайна оставлены тестовые запреты.

Robots.txt и GEO

Для GEO robots.txt важен как условие доступности контента. Если страницы глоссария, экспертные статьи, FAQ или связанные термины случайно закрыты от сканирования, поисковые и ИИ-системы могут не получить эти материалы как источники.

Чек-лист robots.txt

  • Файл доступен по адресу /robots.txt.
  • Важные страницы не закрыты.
  • CSS, JS и изображения доступны, если нужны для рендеринга.
  • Sitemap указан корректно.
  • Административные и служебные разделы закрыты.
  • Параметры и фильтры обработаны по стратегии.
  • Файл проверен в Яндекс Вебмастере и Google Search Console.
  • После редизайна правила пересмотрены.
Комментарий эксперта

Robots.txt — мощный, но опасный инструмент. Одна строка может закрыть от обхода весь сайт или важный каталог. Поэтому любые правки нужно проверять до внедрения и после него. Для SEO важно помнить: robots.txt управляет сканированием, а не заменяет canonical, noindex и нормальную структуру сайта.

Вопросы и ответы о robots.txt

Что такое robots.txt?

Robots.txt — это текстовый файл с правилами обхода сайта для поисковых роботов.

Где находится robots.txt?

В корне сайта, обычно по адресу https://site.ru/robots.txt.

Robots.txt удаляет страницы из индекса?

Нет. Он управляет обходом. Для удаления из индекса чаще используют noindex, 404, 410 или инструменты поисковых систем.

Можно ли закрывать CSS и JS?

Обычно не стоит, если они нужны поисковым системам для рендеринга и понимания страницы.

Что будет, если закрыть сайт через Disallow: /?

Роботам будет запрещён обход сайта. Это может серьёзно навредить сканированию и индексации, если сделано случайно.

Связанные термины

Материал был полезен?