SEO з Ігорем Абрамовським
Як Google знаходить нові сайти та сторінки?
Як Google знаходить нові сайти та сторінки в інтернеті? Розбираємо роль посилань, XML-карт сайтів (sitemap), процес краулінгу та індексації простими словами.

1. Як Google взагалі дізнається про існування нового сайту або нової сторінки?

Оскільки центрального реєстру всіх вебсторінок в Інтернеті не існує, Google змушений постійно шукати нові адреси. Цей процес пошуку називається «виявленням URL» (URL discovery). Google дізнається про нові сторінки кількома основними шляхами:

Перехід за посиланнями: пошуковий робот знаходить посилання на нову сторінку під час сканування вже відомої йому адреси (наприклад, коли на популярному блозі з'являється лінк на новий сайт).

Файли Sitemaps: власники сайтів самі передають список важливих сторінок пошуковій системі.

Пряме надсилання: розробники або SEO-фахівці можуть вручну надіслати запит на перевірку сторінки через Google Search Console (інструмент URL Inspection).

Referrer logs сторонніх сайтів: якщо користувач переходить за посиланням з вашого нового сайту на будь-який сторонній ресурс, ваша адреса фіксується у referrer-тегах і може бути виявлена Google.


2. Яку роль у виявленні нових URL відіграє Googlebot?

Googlebot — це узагальнена назва автоматизованих програм-краулерів (роботів, павуків), які Google використовує для регулярного дослідження Інтернету. Його головна роль полягає в автоматизованому та масштабному зборі інформації.

Googlebot працює у два основні підвиди: Googlebot Smartphone (пріоритетний мобільний робот) та Googlebot Desktop (допоміжний десктопний робот). Він зчитує вміст сторінок, завантажує код, а також вилучає всі знайдені на них посилання, щоб додати їх до глобального списку відомих адрес для подальшого обходу.


3. Як внутрішні посилання допомагають Google знаходити нові сторінки сайту?

Внутрішні посилання є головними «дорогами», якими Googlebot пересувається вашим сайтом.

Коли робот завантажує та аналізує початковий HTML-код сторінки, він шукає в ньому стандартні теги посилань (href). Виявивши лінк, який веде на нову чи оновлену сторінку вашого ж сайту, Googlebot додає цю адресу до своєї черги сканування. Наявність звичайних текстових HTML-посилань критично важлива, оскільки вони дозволяють роботу дістатися до найглибших куточків сайту та чітко сигналізують пошуковій системі, які саме розділи ви вважаєте найбільш пріоритетними.


4. Як зовнішні посилання з інших сайтів можуть допомогти Google знайти новий URL?

Зовнішні посилання (backlinks) діють для робота як вказівники на сторонніх ресурсах.

Оскільки Googlebot безперервно сканує трильйони сторінок по всьому Інтернету, натрапляння на посилання, що веде на ваш новий сайт, миттєво робить його відомим для системи. Робот фіксує новий URL і планує візит до нього. Навіть якщо ваш сайт повністю закритий і ви ніде його не афішували, достатньо лише одного кліку користувача по зовнішньому лінку, щоб адреса потрапила до referrer-логів стороннього сервера, звідки Googlebot зможе її зчитати та додати до своєї черги.


5. Що таке XML Sitemap і як він допомагає Google знаходити сторінки?

XML Sitemap (карта сайту) — це файл у спеціальному форматі, який містить перелік усіх важливих сторінок вашого сайту, призначений суто для пошукових систем.

Він допомагає Googlebot кількома способами:

Миттєве виявлення: робот дізнається про існування сторінок напряму, оминаючи необхідність послідовного переходу по внутрішніх лінках.

Пріоритезація оновлень: за допомогою тегу <lastmod> ви вказуєте дату останнього редагування сторінки, що сигналізує роботу про необхідність повторно сканувати її для оновлення даних у видачі.

Медіа-підтримка: спеціальні розширення карт сайту допомагають роботу знаходити зображення та відео, які важко виявити звичайним шляхом.

Sitemap є незамінним для великих порталів та інтернет-магазинів із глибокою структурою, де товари можуть знаходитися надто далеко від головної сторінки.


6. Чи гарантує додавання URL у sitemap, що Google його просканує та проіндексує?

Ні, абсолютно не гарантує. Google чітко наголошує, що sitemap — це лише рекомендаційна підказка для виявлення (discovery hint), а не обов'язкова інструкція для індексації.

Пошукова система може проігнорувати URL із карти сайту, якщо:

Сторінка має низьку якість контенту.

Вміст є дублікатом іншої сторінки.

На сторінці наявні технічні заборони (наприклад, метатег noindex або блокування у robots.txt).

У сайту низький попит на сканування (crawl demand) або обмежений бюджет сканування (crawl budget).


7. Що відбувається після того, як Google уперше знаходить новий URL?

Після першого виявлення URL-адреси запускається багатоетапний автоматизований процес:

Потрапляння до Crawl Queue (черги сканування): Google вносить URL до списку на обхід, пріоритезуючи його на основі авторитетності сайту, популярності сторінки та швидкості роботи вашого сервера.

Перевірка robots.txt: перед безпосереднім запитом Googlebot звертається до файлу robots.txt, щоб переконатися, що йому дозволено завантажувати цю сторінку.

Сканування (Crawling): робот робить запит до сервера та завантажує вихідний HTML-код сторінки разом із медіафайлами.

Рендеринг (Rendering): якщо сторінка побудована з використанням JavaScript, вона стає в окрему чергу рендерингу (WRS). Спеціальний сервіс на базі Chromium виконує скрипти, щоб побачити фінальний вигляд сторінки.

Індексування (Indexing): Google аналізує тексти, теги <title>, зображення та відео, визначає канонічну версію та приймає рішення про додавання сторінки до своєї бази даних (індексу).


8. Чому Google може знати про сторінку, але ще не просканувати її?

Цей технічний статус у Search Console називається «Discovered – currently not indexed» (Знайдено — не проіндексовано). Google знає про URL, але не здійснює перехід з кількох причин:

Нестача краулінгового бюджету (Crawl Budget): Google має лімітовані ресурси на кожен сайт. Якщо на вашому ресурсі занадто багато дублів, сміттєвих чи параметризованих сторінок, робот витрачає весь час на них і просто не встигає дійти до нових сторінок.

Низька пріоритетність (Crawl Demand): якщо Google вважає ваш сайт або конкретну тему малопопулярною, не унікальною чи неактуальною, він знижує частоту та глибину сканування.

Низька швидкість сервера: якщо ваш сервер довго відповідає на запити (понад 500-1000 мс) або віддає помилки (статуси 5xx або 429), Googlebot навмисно уповільнює сканування, щоб не перевантажити сервер.


9. Як погана внутрішня структура сайту або сторінки-сироти можуть ускладнювати виявлення контенту?

Сторінки-сироти (orphan pages): це сторінки, які технічно існують на сайті, але на них не веде жодне внутрішнє посилання. Googlebot не може знайти їх природним шляхом через обхід лінків, і такі сторінки змушені сподіватися лише на те, що робот знайде їх у файлі sitemap.

Велика вкладеність: якщо сторінка захована занадто глибоко (наприклад, потрібно зробити понад 4 кліки від головної сторінки), робот може просто не дійти до неї під час чергового сеансу сканування.

Динамічні JS-посилання: якщо лінки на вашому сайті формуються за допомогою JavaScript (наприклад, з'являються тільки після того, як користувач клікнув на фільтр або кнопку «Показати ще»), Googlebot не побачить їх під час першої хвилі сканування (Phase 1, коли JS ще не виконується). Це суттєво затримує виявлення таких сторінок.


10. Що SEO-фахівець повинен зробити, щоб Google швидше та стабільніше знаходив нові сторінки сайту?

Щоб оптимізувати процес виявлення та завантаження нових сторінок, SEO-фахівцю необхідно впровадити такі технічні рішення:

Створити плоску архітектуру сайту: переконатися, що будь-яка важлива сторінка знаходиться на відстані не більше 3-4 кліків від головної (наприклад, за логічною структурою: Homepage → Category → Subcategory → Product).

Реалізувати чисті HTML-посилання: уникати динамічних посилань на базі JS-скриптів, натомість використовувати класичні теги href, які Googlebot може легко зчитувати без запуску рендерингу.

Оптимізувати швидкість сервера (TTFB): покращити продуктивність сервера, прагнучи до часу відповіді у межах 100–200 мс. Швидкий відгук сервера є прямим сигналом для Googlebot збільшити кількість паралельних з'єднань і сканувати більше сторінок.

Підтримувати XML Sitemap у чистоті: налаштувати автоматичне оновлення карти сайту, виключаючи звідти сторінки з редиректами, помилками 404, soft 404 та тегами noindex. Використовувати segmented sitemaps (розділені за типами контенту картки) для кращого моніторингу в GSC.

Раціонально витрачати Crawl Budget: налаштувати файл robots.txt для блокування сканування технічних сторінок, результатів пошуку, сортувань та фільтрів, які створюють дублі та марнують час пошукових роботів.

Використовувати правильний рендеринг: для сайтів на JS-фреймворках впровадити Server-Side Rendering (SSR) або Static Site Generation (SSG), щоб робот бачив готовий контент та посилання миттєво під час першого ж запиту HTML.

Працювати з інструментами GSC: регулярно аналізувати звіт Crawl Stats та використовувати функцію Request Indexing для швидкої ручної відправки на переіндексацію найбільш пріоритетних або щойно оновлених сторінок сайту.


Продовжуйте навчання

Останні матеріали цього курсу

Що SEO-фахівець може контролювати в Google, а що контролювати неможливо?
Автор: Ігор Абрамовський

Дізнайтеся межі контролю в SEO: якими процесами на сайті та у видачі Google ми можемо керувати, а які повністю залежать від зовнішніх алгоритмів.

Обговорення та запитання (0)

Поки що тут немає запитань або коментарів. Будьте першим, хто розпочне обговорення.

Додати повідомлення

Тип повідомлення