Что можно указать в robots.txt
- User-agent. Указывает, к какому роботу относятся правила.
- Disallow. Запрещает обход указанного раздела или URL-шаблона.
- Allow. Разрешает обход внутри закрытого раздела.
- Sitemap. Указывает путь к карте сайта.
- Crawl-delay. Ограничивает частоту обращений для некоторых роботов, но поддерживается не всеми.
- Clean-param. Используется Яндексом для обработки параметров URL.
Пример robots.txt
HTML
User-agent: *
Disallow: /admin/
Disallow: /search/
Allow: /upload/
Sitemap: https://site.ru/sitemap.xmlВ этом примере всем роботам запрещён обход административного раздела и поиска по сайту, разрешён доступ к папке upload и указан sitemap.xml.
Robots.txt и индексация
Важно понимать: robots.txt управляет сканированием, а не гарантированным удалением страницы из индекса. Если URL закрыт в robots.txt, поисковый робот может не зайти на страницу и не увидеть meta noindex. При этом URL может оставаться в индексе, если на него есть внешние или внутренние ссылки.
Если нужно именно убрать страницу из поиска, чаще используют noindex, удаление URL, 404/410 или другие методы по ситуации. Robots.txt нужен прежде всего для контроля обхода.
Что обычно закрывают в robots.txt
- административные разделы;
- служебные URL;
- результаты поиска по сайту;
- корзину и оформление заказа;
- личный кабинет;
- технические параметры;
- страницы сортировок и слабых фильтров;
- дубли, которые не нужно сканировать;
- тестовые разделы, если они не должны обходиться.
Что нельзя закрывать без проверки
- важные категории;
- карточки товаров;
- страницы услуг;
- CSS и JavaScript, нужные для рендеринга;
- изображения, если они важны для поиска;
- sitemap.xml;
- разделы, которые должны получать органический трафик.
Частые ошибки robots.txt
- случайно закрыт весь сайт через Disallow: /;
- закрыты CSS и JS;
- закрыты важные посадочные страницы;
- robots.txt отдаёт 404, 403 или 500;
- в sitemap указан неактуальный адрес;
- путают robots.txt и noindex;
- пытаются скрыть секретные данные через robots.txt;
- правила написаны для одного робота, а ожидается действие для всех;
- после редизайна оставлены тестовые запреты.
Robots.txt и GEO
Для GEO robots.txt важен как условие доступности контента. Если страницы глоссария, экспертные статьи, FAQ или связанные термины случайно закрыты от сканирования, поисковые и ИИ-системы могут не получить эти материалы как источники.
Чек-лист robots.txt
- Файл доступен по адресу /robots.txt.
- Важные страницы не закрыты.
- CSS, JS и изображения доступны, если нужны для рендеринга.
- Sitemap указан корректно.
- Административные и служебные разделы закрыты.
- Параметры и фильтры обработаны по стратегии.
- Файл проверен в Яндекс Вебмастере и Google Search Console.
- После редизайна правила пересмотрены.
Комментарий экспертаRobots.txt — мощный, но опасный инструмент. Одна строка может закрыть от обхода весь сайт или важный каталог. Поэтому любые правки нужно проверять до внедрения и после него. Для SEO важно помнить: robots.txt управляет сканированием, а не заменяет canonical, noindex и нормальную структуру сайта.
Вопросы и ответы о robots.txt
Robots.txt — это текстовый файл с правилами обхода сайта для поисковых роботов.
В корне сайта, обычно по адресу https://site.ru/robots.txt.
Нет. Он управляет обходом. Для удаления из индекса чаще используют noindex, 404, 410 или инструменты поисковых систем.
Обычно не стоит, если они нужны поисковым системам для рендеринга и понимания страницы.
Роботам будет запрещён обход сайта. Это может серьёзно навредить сканированию и индексации, если сделано случайно.
Связанные термины
- robots.txt;
- User-agent;
- Disallow;
- Allow;
- Sitemap;
- Clean-param;
- noindex;
- crawling;
- индексация;
- Googlebot;
- ЯндексБот;
- технический аудит сайта;
- SEO-аудит;
- GEO.

