Що таке crawl budget?


Що таке crawl budget (краулінговий бюджет) простими словами?
Краулінговий бюджет (crawl budget) — це обсяг ресурсів пошукової системи, а саме кількість URL-адрес, які робот Googlebot може та одночасно хоче просканувати на вашому сайті за певний проміжок часу.
Простими словами: це «ліміт уваги» Google, який він виділяє вашому веб-ресурсу. Google не має безмежних технічних можливостей для моментального сканування абсолютно всього Інтернету. Тому для кожного окремого хоста встановлюється обмеження на кількість сторінок, які робот завантажить під час візиту, щоб не перевантажити ваш сервер і водночас отримати найважливішу інформацію.
З яких основних складових формується crawl budget?
Кінцевий краулінговий бюджет сайту є результатом множення двох основних показників:
Crawl capacity limit (ліміт ємності сканування): технічна складова, яка визначає, скільки одночасних запитів ваш сервер здатний обробити без погіршення швидкості роботи.
Crawl demand (попит на сканування): аналітична складова, яка показує, наскільки сильно алгоритми Google взагалі зацікавлені в отриманні оновлень із вашого сайту.
Що таке crawl capacity (ліміт ємності)?
Crawl capacity limit (або hostload) — це межа інтенсивності сканування, яку Google розраховує для захисту вашого сервера від перевантаження. Вона регулює кількість паралельних з'єднань, які Googlebot може тримати відкритими, та тривалість паузи між запитами.
Важливі особливості ліміту ємності:
Вплив стабільності сайту: якщо сервер працює швидко, а час першої відповіді (TTFB) стабільний або покращується, ліміт автоматично зростає. Якщо сервер уповільнюється чи видає помилки з кодом 5xx або 429 (забагато запитів), ліміт миттєво знижується, і Google сканує менше.
Спільний ресурс: цей ліміт є спільним для всіх краулерів Google. Googlebot, AdsBot, робот Google Shopping та AI-краулер Google-Extended (який збирає дані для Gemini та AI Overviews) ділять одну ємність сервера. Якщо один бот створює велике навантаження, ліміти для інших автоматично зменшуються.
Стартовий рівень: і нові, і старі домени починають роботу з однакового консервативного базового ліміту ємності.
Що таке crawl demand (попит на сканування)?
Crawl demand — це показник того, наскільки часто та глибоко Google вважає за потрібне сканувати ваш контент. Попит формується незалежно від можливостей сервера та базується на таких критеріях:
Популярність: більш популярні в мережі сторінки робот відвідує частіше, щоб підтримувати їхню актуальність у базі.
Свіжість та частота оновлень (staleness): пошукова система намагається вчасно фіксувати зміни контенту та уникати його застарівання.
Якість та унікальність: корисний та унікальний вміст генерує вищий попит, тоді як дублікати чи низькоякісні сторінки цей попит знижують.
Події на сайті: перенесення сайту на новий домен чи реорганізація структури тимчасово підвищують попит на сканування для швидкої переіндексації.
Для яких сайтів crawl budget справді може стати важливою SEO-проблемою?
Оптимізація бюджету сканування — це просунута технічна задача, яка є критичною для таких типів веб-ресурсів:
Гігантські сайти: ресурси, що мають понад 1 мільйон унікальних сторінок, вміст яких оновлюється з помірною частотою (наприклад, раз на тиждень).
Динамічні середні та великі ресурси: сайти з обсягом від 10 000 унікальних сторінок, контент на яких змінюється дуже швидко — щоденно (великі інтернет-магазини, маркетплейси, новинні агенції, форуми).
Сайти зі складною навігацією: ресурси, де через велику кількість фільтрів (фасетну навігацію) утворюються мільйони автоматично згенерованих адрес.
Ресурси, у яких в панелі Google Search Console велика кількість сторінок роками залишається в статусі «Discovered – currently not indexed» (Знайдено — не проіндексовано).
Чому невеликим сайтам зазвичай не потрібно сильно хвилюватися про crawl budget?
Для малих і середніх сайтів (обсягом до кількох тисяч сторінок) краулінговий бюджет не є перешкодою. Google офіційно заявляє, що якщо ваші нові сторінки скануються в день їх публікації, то фокусуватися на цій темі непотрібно.
Для сайтів із обсягом менше 1000 сторінок Googlebot безперешкодно та в повному обсязі встигає завантажити всі адреси. Таким ресурсам достатньо просто стежити за звітом про індексацію сторінок і підтримувати в актуальному стані карту сайту (Sitemap).
Які типи непотрібних URL можуть марно витрачати ресурси Googlebot?
Існує велика кількість технічного «шуму», який поглинає корисні ресурси робота. Google виділяє такі головні типи марних сторінок:
Параметризовані сторінки сортування, сесійні ідентифікатори та фільтри фасетної навігації.
Внутрішній дубльований контент.
Сторінки м'яких помилок (soft 404).
Зламані або захакані спам-сторінки.
«Нескінченні простори» (наприклад, неналаштовані календарі без кінцевої дати або нескінченна пагінація).
Адреси з битими відносними посиланнями, які створюють циклічні повторення шляхів.
Низькоякісний контент та відвертий спам.
Як дублікати, параметри URL, faceted navigation, редиректи та soft 404 можуть впливати на Crawling?
Кожен із цих факторів створює серйозне навантаження на систему сканування:
Дублікати та параметри URL: створюють мільйони унікальних адрес, що ведуть на ідентичний контент. Бот витрачає гігабайти трафіку на завантаження однакових сторінок, через що корисні сторінки довше залишаються несканованими.
Фасетна навігація (фільтри): генерує нескінченну кількість комбінацій параметрів у URL. Робот не здатний заздалегідь зрозуміти корисність адреси без її завантаження. Як результат, він обходить тисячі комбінацій фільтрів, перш ніж алгоритм позначить їх як некорисні, суттєво сповільнюючи виявлення нових цільових сторінок.
Редиректи: у разі наявності довгих ланцюжків перенаправлень (наприклад, сторінка 1 → сторінка 2 → сторінка 3) Googlebot змушений робити окремий послідовний HTTP-запит для кожного кроку. Це в рази збільшує витрати бюджету сканування на перевірку всього однієї кінцевої сторінки контенту.
Soft 404 (м'які помилки): це сторінки, які фактично пусті або містять інформацію про помилку, але повертають серверний код успіху HTTP 200. Оскільки сервер заявляє, що сторінка успішна, Googlebot продовжує регулярно повертатися до неї та сканувати її знову й знову, даремно спалюючи ваш ліміт сканування.
Як SEO-фахівець може перевірити, наскільки ефективно Googlebot сканує великий сайт?
Для оцінки ефективності сканування використовують два основні підходи:
Аналіз звіту «Статистика сканування» (Crawl Stats) у Google Search Console: Він міститься в розділі «Налаштування» > «Статистика сканування» (доступно лише для властивостей на рівні кореневого домену). Цей інструмент дозволяє відстежувати:
Загальну кількість запитів та завантажений обсяг: різкі стрибки чи спади сканування.
Середній час відповіді сервера: критично важливий показник стабільності хостингу.
Статус хоста (Host status): наявність проблем із доступністю файлу robots.txt, збоїв DNS чи підключення до сервера за останні 90 днів.
Розподіл кодів відповідей: яка частка запитів припадає на корисні коди 200 та 304, а скільки ресурсів з'їдають помилки (5xx, 4xx) чи редиректи (3xx).
Розподіл за типами файлів та роботів: скільки запитів витрачається на HTML-сторінки, а скільки — на другорядні CSS, JS та зображення.
Аналіз серверних логів (Server Log Analysis): Найбільш точний метод для великих сайтів. Перегляд сирих журналів сервера дає змогу побачити кожен реальний запит Googlebot у режимі реального часу та виявити приховане сканування непотрібних технічних розділів сайту, яке ще не відобразилося в Search Console.
Що можна зробити, щоб Googlebot витрачав більше ресурсів на важливі сторінки, а не на технічний або низькоцінний шум?
Для оптимізації витрат краулінгового бюджету SEO-спеціалісту необхідно впровадити комплекс технічних рішень:
Налаштувати robots.txt: це найнадійніший інструмент контролю сканування. Закрийте директивою Disallow технічні розділи, кошики, сторінки внутрішнього пошуку, нескінченні календарі та дублікати фільтрів.
Важливе правило: не використовуйте метатег noindex для економії бюджету сканування. Бот все одно має завантажити сторінку, щоб побачити цей тег, тому ресурси на сканування все одно будуть витрачені. robots.txt — єдиний інструмент, який повністю запобігає запиту до сторінки.
Підтримувати HTTP-кешування (статус 304 Not Modified): налаштуйте сервер так, щоб він повертав статус 304 для сторінок, контент яких не змінився з моменту останнього візиту робота. Це сигналізує Googlebot використовувати збережену копію без завантаження тіла сторінки заново, що суттєво економить пропускну здатність вашого сервера та вивільняє ліміти для інших сторінок.
Collapse (схлопування) редиректів: перепишіть правила перенаправлень так, щоб старі адреси вели безпосередньо на фінальну цільову URL (без проміжних кроків). Оновіть усі внутрішні посилання в меню та текстах, щоб вони посилалися на кінцеві адреси з кодом відповіді 200 OK.
Усунути soft 404 помилки: переконайтеся, що видалені або неіснуючі сторінки віддають чіткий серверний статус 404 (Not Found) або 410 (Gone), що змусить Googlebot поступово знизити частоту їх перевірки.
Керувати канонічністю сторінок: використовуйте елемент rel="canonical" на сторінках із параметрами, щоб об'єднати дублікати й вказати пошуковій системі пріоритетну версію для обходу.
Тримати карту сайту в чистоті: файл sitemap.xml має містити виключно відкриті для індексації канонічні сторінки зі статусом 200. Використовуйте тег <lastmod>, щоб повідомляти робота тільки про реальні суттєві зміни контенту.
Прискорити сервер: покращуйте час відповіді сервера та швидкість завантаження сторінок (Core Web Vitals). Швидкий та стабільний сервер безпосередньо стимулює алгоритми Google автоматично підвищувати ліміт ємності сканування (crawl capacity limit).
Продовжуйте навчання
Останні матеріали цього курсу

Як Google вирішує, що сканувати частіше? Пояснюємо принципи пріоритезації URL, краулінговий бюджет та вплив активності на оновлення індексу.

Яку роль відіграють внутрішні та зовнішні посилання у знаходженні сторінок? Пояснюємо механізми переходу Googlebot за посиланнями.

Дізнайтеся, як пошуковий робот Google виявляє нові URL. Яку роль відіграє внутрішнє перелінкування, зовнішні посилання та краулінговий бюджет для SEO.

Які існують типи роботів Google? Пояснюємо призначення Googlebot Smartphone, принципи Mobile-first та вплив на ранжування сайтів.
Обговорення та запитання (0)
Поки що тут немає запитань або коментарів. Будьте першим, хто розпочне обговорення.