SEO з Ігорем Абрамовським
Як Googlebot знаходить нові URL?
Як Googlebot знаходить нові URL-адреси в мережі? Розбираємо процес відкриття сторінок за посиланнями, через XML-карти сайту (sitemap) та історію сканування.

1. Якими основними способами Googlebot може знайти новий URL?

Пошукова система Google не має єдиного центрального реєстру всіх вебсторінок, тому вона повинна безперервно відкривати нові адреси. Процес виявлення нових URL відбувається за допомогою таких основних джерел:

Внутрішні посилання: Googlebot переходить за посиланнями з уже відомих і раніше просканованих сторінок на нові (наприклад, з головної сторінки чи розділу категорій на щойно опубліковану статтю).

Карти сайту (Sitemaps): власники веб-ресурсів самостійно надають Google список пріоритетних сторінкових адрес для обходу.

Зовнішні посилання: робот знаходить лінки, які ведуть на ваш сайт, під час сканування сторонніх веб-ресурсів.

Історія попередніх обходів: Googlebot регулярно повертається до вже відомих йому адрес, щоб виявити оновлення вмісту чи нові лінки.


2. Як Googlebot знаходить нові сторінки через внутрішні посилання сайту?

Внутрішні посилання є головною структурою для пересування робота всередині сайту. Googlebot виявляє їх за таким принципом:

Сканування HTML-коду: завантажуючи сторінку, робот зчитує її вихідний код і шукає посилання.

Стандартні теги: Google може надійно розпізнати та просканувати посилання лише в тому разі, якщо воно реалізоване як HTML-елемент <a> (якір) з обов'язковим атрибутом href (наприклад, <a href="/category/page">).

Динамічні JS-посилання: якщо посилання впроваджуються за допомогою JavaScript динамічно, вони залишаються доступними для бота за умови використання правильного HTML-формату <a> з атрибутом href.

Чого робити не варто: якщо навігація побудована на базі скриптових подій (як-от <div onclick="window.location..."> або використання інших тегів без href), Googlebot не зможе клікати на кнопки й переходити за ними, через що внутрішня вага та посилання нікуди не передадуться.


3. Яку роль у виявленні нових URL відіграють зовнішні посилання з інших сайтів?

Зовнішні посилання (backlinks) виступають для Googlebot додатковими точками входу на ваш ресурс. Коли робот сканує інші сайти в Інтернеті й натрапляє на посилання, що веде на вашу нову сторінку, він додає цю адресу до своєї бази виявлених URL. Крім того, зовнішні посилання передають авторитет («link juice»), що допомагає пошуковій системі оцінити важливість нової адреси та підвищити пріоритет її подальшого обходу.


4. Як XML Sitemap допомагає Google дізнатися про нові або оновлені сторінки?

Файл XML Sitemap — це пряме звернення власника сайту до пошукової системи з переліком усіх канонічних та важливих для індексації сторінок. Карта сайту допомагає Google у такі способи:

Швидке виявлення: робот миттєво дізнається про існування нових URL-адрес без потреби довго чекати, поки він знайде їх через ланцюжки внутрішніх чи зовнішніх посилань.

Пріоритет за оновленнями: за допомогою тегу <lastmod> вебмайстер повідомляє дату останньої суттєвої зміни контенту (наприклад, оновлення тексту, лінків чи структурованих даних). Якщо дата свіжа й верифікується алгоритмами, Googlebot швидше запланує повторне сканування для оновлення результатів у видачі.

Додатковий контекст: sitemap дозволяє передавати метадані про зображення, відео та новинні публікації, а також вказувати локалізовані версії сторінок.

Контроль лімітів: великі сайти можуть розділяти карти на окремі сегменти (наприклад, за категоріями, з лімітом до 50 000 URL або 50 МБ на один файл sitemap), щоб зручніше відстежувати ефективність їхнього обходу в Search Console.


5. Чи гарантує наявність URL у sitemap, що Googlebot обов’язково його просканує?

Ні, абсолютно не гарантує. Надання карти сайту є лише рекомендаційною підказкою (discovery hint) для пошукової системи. Google Search Central чітко зазначає, що Google не дає жодних гарантій щодо обов'язкового завантаження sitemap чи сканування та індексації вказаних у ній адрес, навіть якщо ваш вебсайт повністю відповідає базовим вимогам Google Search Essentials.


6. Що відбувається після того, як Google уперше дізнається про новий URL?

Після первинного виявлення нової адреси запускається наступний ланцюжок процесів:

Потрапляння до черги (Queueing): URL-адресу додають до загальної бази даних — черги сканування Googlebot (Crawl Queue).

Аналіз пріоритету (Scheduling): алгоритмічна система планування оцінює, коли саме варто відвідати цей URL, з якою частотою обходити сайт і скільки сторінок завантажувати, щоб не перевантажити сервер вашого хостингу.

Етап сканування (Crawling): робот надсилає HTTP-запит до сервера, завантажує вихідний код HTML та вилучає нові лінки.

Рендеринг (Rendering): якщо на сторінці є JavaScript, адреса стає у чергу рендерингу (WRS), де спеціальна служба на базі Chromium запускає виконання скриптів для відтворення повного візуального вигляду сторінки.

Індексація (Indexing): аналізується фінальний вміст (текст, метатеги, медіа), визначається канонічність сторінки та ухвалюється рішення про збереження даних у пошуковому індексі.


7. Чому між виявленням URL і його фактичним Crawling може пройти певний час?

Цей стан очікування в Google Search Console позначається статусом «Discovered - currently not indexed» (Знайдено — не проіндексовано). Затримка виникає через те, що ресурси Google на сканування (Crawl Budget) обмежені, і система змушена розставляти пріоритети.

Основні причини затримок:

Низька авторитетність сайту (Crawl Demand): нові або маловідомі домени отримують менший ліміт сканування, тому черга просувається повільніше.

Низька швидкість сервера (TTFB): якщо сервер сайту занадто повільно відповідає на запити або видає помилки (наприклад, HTTP 500 чи 503), Googlebot навмисно уповільнює частоту обходу, щоб запобігти падінню вашого ресурсу.

Марнування бюджету сканування: наявність великої кількості дублікатів сторінок, технічного сміття (параметрів сортування, нескінченних фільтрів, сесійних ідентифікаторів у URL) змушує робота витрачати ресурси на непотрібні сторінки, залишаючи цільові URL у статусі очікування.


8. Що таке orphan page і чому сторінки без внутрішніх посилань Google може знаходити складніше?

Orphan page (сторінка-сирота) — це вебсторінка сайту, на яку не веде жодне внутрішнє посилання з інших розділів чи сторінок цього ж ресурсу.

Googlebot та інші краулери (зокрема, боти ШІ-систем на кшталт ChatGPT чи Perplexity) передусім орієнтуються на переходи за лінками. Сторінки-сироти знайти значно складніше з кількох причин:

Брак сигналів важливості: Google використовує внутрішні лінки як індикатор цінності контенту. Якщо ви самі не посилаєтеся на свою сторінку всередині сайту, пошукова система робить логічний висновок, що цей контент є малоцінним, і може взагалі проігнорувати його сканування.

Ізоляція від внутрішньої ваги (Link Equity): без вхідних внутрішніх лінків сторінка не отримує авторитету сайту, тому навіть у разі випадкового виявлення через sitemap вона матиме серйозні труднощі з ранжуванням у видачі.


9. Як редиректи та canonical можуть впливати на те, які URL Googlebot знаходить і вважає основними?

Редиректи (наприклад, 301): вказують Google, що стара адреса сторінки змінилася на нову. Однак, якщо в структурі сайту (в меню, статтях, картах sitemap) залишаються посилання, що ведуть на старі адреси з редиректами, це створює хаос:

Googlebot змушений робити зайві HTTP-запити, що безглуздо витрачає краулінговий бюджет.

Збільшується час відповіді (помилки 301 обробляються сервером значно повільніше, ніж прямі сторінки 200 OK).

Пошукова система отримує суперечливі сигнали, що суттєво уповільнює оновлення індексу для нових адрес.

Canonical (канонічні теги): допомагають Google впорядкувати дубльований вміст. Googlebot групує схожі за вмістом сторінки в кластери й вибирає одну головну (канонічну) адресу для показу у видачі. Якщо внутрішні лінки посилаються на один варіант URL, а тег canonical вказує на інший (конфлікт сигналів), робот почне витрачати ресурси на сканування обох версій, знижуючи швидкість індексації сайту.


10. Що SEO-фахівець може зробити, щоб Googlebot швидше й стабільніше знаходив важливі нові сторінки сайту?

Для оптимізації швидкості та стабільності знаходження нових сторінок SEO-спеціалісту необхідно впровадити такі кроки:

Побудувати плоску та логічну структуру: переконатися, що до будь-якої важливої сторінки можна дістатися максимум за 3–4 кліки від головної сторінки сайту.

Створити якісну внутрішню перелінковку: пов'язати нові сторінки з уже проіндексованими тематичними розділами та авторитетними хабами вашого сайту. Організувати контент у логічні кластери (хаби та спиці).

Очистити внутрішні посилання від редиректів: регулярно сканувати сайт та оновлювати всі внутрішні лінки, щоб вони вели безпосередньо на фінальні URL-адреси з кодом відповіді сервера 200 OK (без проміжних 301 редиректів та ланцюжків перенаправлень).

Використовувати лише чистий HTML для посилань: уникати використання скриптових чи динамічних JS-кнопок для важливої навігації. Посилання мають бути прописані у тегах <a> з атрибутом href.

Підтримувати XML Sitemap у чистоті: налаштувати автоматичне оновлення карти сайту так, щоб туди потрапляли лише канонічні, індексовані сторінки зі статусом відповіді 200 OK. Своєчасно та коректно оновлювати дату <lastmod> у разі важливих змін контенту.

Оптимізувати продуктивність сервера: знижувати час відповіді сервера (TTFB) та усувати помилки доступності (5xx), що дозволить Googlebot завантажувати більше сторінок за одиницю часу без ризику перевантаження вашої інфраструктури.


Продовжуйте навчання

Останні матеріали цього курсу

Що SEO-фахівець може контролювати в Google, а що контролювати неможливо?
Автор: Ігор Абрамовський

Дізнайтеся межі контролю в SEO: якими процесами на сайті та у видачі Google ми можемо керувати, а які повністю залежать від зовнішніх алгоритмів.

Обговорення та запитання (0)

Поки що тут немає запитань або коментарів. Будьте першим, хто розпочне обговорення.

Додати повідомлення

Тип повідомлення