Адрес

г. Москва
Проспект Мира 101 с1

Crawling: что это такое и как поисковые роботы сканируют сайт

  • 08.07.2026
  • 28

Crawling, или сканирование сайта, — это процесс, при котором поисковые роботы обходят страницы сайта, загружают их содержимое и находят новые URL для последующей обработки и индексации. Без сканирования страница не может нормально попасть в поисковую систему.

Простыми словами, crawling — это обход сайта поисковым роботом. Робот приходит на страницу, читает HTML, переходит по ссылкам, проверяет коды ответа, ресурсы, canonical, robots.txt и другие технические сигналы. Затем поисковая система решает, что делать с найденной страницей дальше.

Как работает crawling

  1. Поисковая система получает URL из ссылок, sitemap.xml, старого индекса или внешних источников.
  2. Робот проверяет robots.txt и правила доступа.
  3. Загружает страницу и получает HTTP-код ответа.
  4. Анализирует HTML, ссылки, canonical, meta robots и ресурсы.
  5. Передаёт страницу на рендеринг и индексацию, если она подходит.
  6. Добавляет найденные ссылки в очередь обхода.

Crawling и индексация: в чём разница

Сканирование и индексация — разные этапы. Страница может быть просканирована, но не попасть в индекс. Например, если она содержит noindex, является дублем, имеет низкое качество, закрыта canonical на другую страницу или возвращает ошибку.

ЭтапЧто происходит
CrawlingРобот заходит на страницу и загружает её данные.
IndexingПоисковая система решает, добавлять ли страницу в индекс.
RankingСтраница участвует в выдаче и оценивается по запросам.

Что влияет на сканирование сайта

  • Robots.txt. Может разрешать или запрещать обход разделов.
  • Sitemap.xml. Помогает передать важные URL поисковым системам.
  • Внутренняя перелинковка. Чем лучше страницы связаны, тем проще их найти.
  • Коды ответа. 200, 301, 404, 500 и другие статусы влияют на обход.
  • Скорость сервера. Медленный сервер ограничивает эффективный обход.
  • Дубли и параметры. Мусорные URL расходуют ресурс робота.
  • JavaScript. Если ссылки и контент появляются только после рендеринга, обход может усложняться.
  • Доступность для ботов. WAF, CDN и firewall не должны блокировать легитимных роботов.

Что такое crawl budget

Crawl budget, или краулинговый бюджет, — это условный ресурс обхода, который поисковая система готова тратить на сайт за определённый период. Для маленьких сайтов он обычно не является проблемой. Для крупных интернет-магазинов, порталов и сайтов с тысячами URL crawl budget может стать важным.

Если робот тратит время на дубли, фильтры, сортировки, параметры и технический мусор, важные страницы могут сканироваться реже. Поэтому крупным сайтам нужно управлять структурой, sitemap.xml, canonical, robots.txt и внутренними ссылками.

Ошибки, которые мешают crawling

  • важные страницы закрыты в robots.txt;
  • страницы отдают 500 или 503;
  • много 404 во внутренних ссылках;
  • цепочки и циклы редиректов;
  • sitemap.xml содержит неактуальные URL;
  • фильтры создают тысячи дублей;
  • внутренние ссылки ведут на неканонические URL;
  • WAF блокирует Googlebot или ЯндексБот;
  • контент и ссылки доступны только после сложного JavaScript;
  • страницы глубоко спрятаны и не имеют внутренних ссылок.

Как улучшить сканирование сайта

  1. Проверьте robots.txt. Важные разделы не должны быть закрыты.
  2. Обновите sitemap.xml. В карте должны быть только полезные канонические URL с кодом 200.
  3. Исправьте битые ссылки. Уберите внутренние ссылки на 404 и 500.
  4. Сократите редиректы. Избегайте цепочек и циклов.
  5. Уберите технический мусор. Закройте или канонизируйте параметры, сортировки и слабые фильтры.
  6. Улучшите перелинковку. Важные страницы должны быть доступны в несколько кликов.
  7. Проверьте сервер. Стабильность, TTFB, лимиты и ошибки важны для обхода.
  8. Проверьте ботов. Firewall, CDN и антибот-защита не должны блокировать поисковых роботов.

Crawling и GEO для ИИ-поиска

Для GEO сканирование — базовое условие. Если поисковая система или ИИ-краулер не может получить страницу, он не сможет использовать её как источник ответа. Поэтому важны доступность HTML, стабильные URL, открытый контент, внутренняя перелинковка и отсутствие технических блокировок.

Даже отличный глоссарий не будет полезен для ИИ-поиска, если страницы закрыты, отдают ошибки, спрятаны без ссылок или требуют сложного рендеринга для получения основного текста.

Чек-лист crawling

  • Robots.txt не закрывает важные страницы.
  • Sitemap.xml содержит актуальные URL.
  • Важные страницы отдают код 200.
  • Нет массовых 404 и 500.
  • Нет цепочек редиректов.
  • Дубли и параметры контролируются.
  • Внутренние ссылки ведут на канонические URL.
  • Страницы не спрятаны слишком глубоко.
  • Googlebot и ЯндексБот не блокируются.
  • Основной контент доступен в HTML или корректно рендерится.
Комментарий эксперта

Crawling — это входная точка SEO. Если поисковый робот не может нормально обойти сайт, всё остальное теряет смысл: контент не будет найден, canonical не будет прочитан, а важные страницы могут остаться вне индекса. В техническом аудите я сначала проверяю доступность, robots.txt, sitemap.xml, коды ответа, внутренние ссылки и мусорные URL, потому что именно они чаще всего расходуют ресурс обхода.

Вопросы и ответы о crawling

Что такое crawling?

Crawling — это сканирование сайта поисковыми роботами, при котором они обходят URL, загружают страницы и находят новые ссылки.

Чем crawling отличается от индексации?

Crawling — это обход и загрузка страницы, а индексация — решение поисковой системы добавить страницу в индекс или нет.

Что такое crawl budget?

Crawl budget — это условный ресурс обхода, который поисковая система готова тратить на сайт. Он особенно важен для крупных сайтов с большим количеством URL.

Что мешает сканированию сайта?

Ошибки robots.txt, 404 и 500, редирект-цепочки, дубли, слабая перелинковка, блокировка ботов, медленный сервер и JavaScript, скрывающий ссылки или контент.

Как улучшить crawling?

Нужно очистить sitemap.xml, исправить битые ссылки, убрать редирект-цепочки, контролировать параметры, улучшить внутреннюю перелинковку и проверить доступ поисковых роботов.

Связанные термины

  • сканирование сайта;
  • Googlebot;
  • ЯндексБот;
  • индексация;
  • crawl budget;
  • robots.txt;
  • sitemap.xml;
  • canonical;
  • редирект;
  • 404 ошибка;
  • технический аудит сайта;
  • SEO-аудит;
  • GEO;
  • ИИ-поиск.

Материал был полезен?