Как работает crawling
- Поисковая система получает URL из ссылок, sitemap.xml, старого индекса или внешних источников.
- Робот проверяет robots.txt и правила доступа.
- Загружает страницу и получает HTTP-код ответа.
- Анализирует HTML, ссылки, canonical, meta robots и ресурсы.
- Передаёт страницу на рендеринг и индексацию, если она подходит.
- Добавляет найденные ссылки в очередь обхода.
Crawling и индексация: в чём разница
Сканирование и индексация — разные этапы. Страница может быть просканирована, но не попасть в индекс. Например, если она содержит noindex, является дублем, имеет низкое качество, закрыта canonical на другую страницу или возвращает ошибку.
| Этап | Что происходит |
|---|---|
| Crawling | Робот заходит на страницу и загружает её данные. |
| Indexing | Поисковая система решает, добавлять ли страницу в индекс. |
| Ranking | Страница участвует в выдаче и оценивается по запросам. |
Что влияет на сканирование сайта
- Robots.txt. Может разрешать или запрещать обход разделов.
- Sitemap.xml. Помогает передать важные URL поисковым системам.
- Внутренняя перелинковка. Чем лучше страницы связаны, тем проще их найти.
- Коды ответа. 200, 301, 404, 500 и другие статусы влияют на обход.
- Скорость сервера. Медленный сервер ограничивает эффективный обход.
- Дубли и параметры. Мусорные URL расходуют ресурс робота.
- JavaScript. Если ссылки и контент появляются только после рендеринга, обход может усложняться.
- Доступность для ботов. WAF, CDN и firewall не должны блокировать легитимных роботов.
Что такое crawl budget
Crawl budget, или краулинговый бюджет, — это условный ресурс обхода, который поисковая система готова тратить на сайт за определённый период. Для маленьких сайтов он обычно не является проблемой. Для крупных интернет-магазинов, порталов и сайтов с тысячами URL crawl budget может стать важным.
Если робот тратит время на дубли, фильтры, сортировки, параметры и технический мусор, важные страницы могут сканироваться реже. Поэтому крупным сайтам нужно управлять структурой, sitemap.xml, canonical, robots.txt и внутренними ссылками.
Ошибки, которые мешают crawling
- важные страницы закрыты в robots.txt;
- страницы отдают 500 или 503;
- много 404 во внутренних ссылках;
- цепочки и циклы редиректов;
- sitemap.xml содержит неактуальные URL;
- фильтры создают тысячи дублей;
- внутренние ссылки ведут на неканонические URL;
- WAF блокирует Googlebot или ЯндексБот;
- контент и ссылки доступны только после сложного JavaScript;
- страницы глубоко спрятаны и не имеют внутренних ссылок.
Как улучшить сканирование сайта
- Проверьте robots.txt. Важные разделы не должны быть закрыты.
- Обновите sitemap.xml. В карте должны быть только полезные канонические URL с кодом 200.
- Исправьте битые ссылки. Уберите внутренние ссылки на 404 и 500.
- Сократите редиректы. Избегайте цепочек и циклов.
- Уберите технический мусор. Закройте или канонизируйте параметры, сортировки и слабые фильтры.
- Улучшите перелинковку. Важные страницы должны быть доступны в несколько кликов.
- Проверьте сервер. Стабильность, TTFB, лимиты и ошибки важны для обхода.
- Проверьте ботов. Firewall, CDN и антибот-защита не должны блокировать поисковых роботов.
Crawling и GEO для ИИ-поиска
Для GEO сканирование — базовое условие. Если поисковая система или ИИ-краулер не может получить страницу, он не сможет использовать её как источник ответа. Поэтому важны доступность HTML, стабильные URL, открытый контент, внутренняя перелинковка и отсутствие технических блокировок.
Даже отличный глоссарий не будет полезен для ИИ-поиска, если страницы закрыты, отдают ошибки, спрятаны без ссылок или требуют сложного рендеринга для получения основного текста.
Чек-лист crawling
- Robots.txt не закрывает важные страницы.
- Sitemap.xml содержит актуальные URL.
- Важные страницы отдают код 200.
- Нет массовых 404 и 500.
- Нет цепочек редиректов.
- Дубли и параметры контролируются.
- Внутренние ссылки ведут на канонические URL.
- Страницы не спрятаны слишком глубоко.
- Googlebot и ЯндексБот не блокируются.
- Основной контент доступен в HTML или корректно рендерится.
Комментарий экспертаCrawling — это входная точка SEO. Если поисковый робот не может нормально обойти сайт, всё остальное теряет смысл: контент не будет найден, canonical не будет прочитан, а важные страницы могут остаться вне индекса. В техническом аудите я сначала проверяю доступность, robots.txt, sitemap.xml, коды ответа, внутренние ссылки и мусорные URL, потому что именно они чаще всего расходуют ресурс обхода.
Вопросы и ответы о crawling
Crawling — это сканирование сайта поисковыми роботами, при котором они обходят URL, загружают страницы и находят новые ссылки.
Crawling — это обход и загрузка страницы, а индексация — решение поисковой системы добавить страницу в индекс или нет.
Crawl budget — это условный ресурс обхода, который поисковая система готова тратить на сайт. Он особенно важен для крупных сайтов с большим количеством URL.
Ошибки robots.txt, 404 и 500, редирект-цепочки, дубли, слабая перелинковка, блокировка ботов, медленный сервер и JavaScript, скрывающий ссылки или контент.
Нужно очистить sitemap.xml, исправить битые ссылки, убрать редирект-цепочки, контролировать параметры, улучшить внутреннюю перелинковку и проверить доступ поисковых роботов.
Связанные термины
- сканирование сайта;
- Googlebot;
- ЯндексБот;
- индексация;
- crawl budget;
- robots.txt;
- sitemap.xml;
- canonical;
- редирект;
- 404 ошибка;
- технический аудит сайта;
- SEO-аудит;
- GEO;
- ИИ-поиск.

