SEO з Ігорем Абрамовським
 Чим Crawling відрізняється від Indexing?

Що таке Crawling простими словами?


Crawling (сканування) — це процес виявлення вмісту в Інтернеті. Простими словами, це коли пошукові роботи (краулери або павуки, такі як Googlebot) переходять за посиланнями ("following your links") від однієї сторінки до іншої. Під час цього процесу робот завантажує текст, зображення та відео з відвіданих вебсторінок для їх подальшої оцінки.


Що таке Indexing і що Google робить зі сторінкою на цьому етапі?

Indexing (індексування) — це процес, під час якого Google аналізує завантажений вміст сторінки та зберігає його у своїй базі даних (індексі Google).

На цьому етапі пошукова система виконує такі дії:

Аналізує вміст: досліджує текст, зображення, відео, ключові теги та атрибути (елементи <title>, атрибути alt тощо), щоб зрозуміти тематику сторінки.

Визначає канонічність сторінки: аналізує, чи є сторінка копією вже наявного в мережі контенту. Google групує схожі сторінки в кластери та обирає одну найрепрезентативнішу адресу як канонічну (саме вона показуватиметься у пошуку).

Збирає сигнали: фіксує мову сторінки, країну її локалізації та зручність для користувача. Якщо сторінка відповідає критеріям якості, вся зібрана інформація зберігається в гігантському індексі.


Яка головна різниця між Crawling та Indexing?

Головна різниця полягає в суті та черговості цих двох етапів:

Сканування (Crawling) — це етап виявлення та завантаження даних. Робот знаходить URL-адресу та зчитує її код.

Індексування (Indexing) — це етап аналізу та збереження. Робот оцінює якість контенту та ухвалює рішення, чи додавати сторінку до пошукової бази.

Послідовність: сканування завжди передує індексуванню (це покроковий процес). Сканування є значно ресурсномісткішим процесом для пошукової системи, тоді як індексування є більш ресурсоефективним, оскільки аналізує вже завантажену інформацію.


Чи може Google знати про URL, але ще не просканувати його?

Так, може. Цей етап називається "виявленням" (Discovery). Google може дізнатися про існування URL-адреси, наприклад, з XML-карти сайту (sitemap), через внутрішні чи зовнішні посилання, але через низький пріоритет сканування чи обмеження краулінгового бюджету ще не здійснити сам перехід на сторінку. У Google Search Console такі сторінки отримують статус "Discovered – currently not indexed".


Чи може Google просканувати сторінку, але не додати її до індексу?

Так, може. Успішне сканування та завантаження коду не гарантують, що сторінка потрапить до пошукової бази. Після завантаження Google оцінює якість сторінки, і якщо вона не проходить якісний поріг або є дублікатом, Google залишає її поза індексом із позначкою "Crawled – currently not indexed".


Які основні причини того, що просканована сторінка не індексується?

Тонкий або малоцінний контент (Thin content): сторінка містить мало тексту (наприклад, менше ніж 500 слів) або складається переважно з шаблонів.

Дубльований вміст (Duplicate content): ідентичний або надто схожий матеріал уже є на вашому або інших сайтах.

Низький авторитет сайту: для висококонкурентних тем Google віддає перевагу авторитетним ресурсам, ігноруючи нові чи слабкі домени.

Погане внутрішнє перелінкування: сторінка є "сиротою" (orphan page) або схована дуже глибоко (більше ніж 4 кліки від головної).

Проблеми з рендерингом JavaScript: якщо основний вміст завантажується через скрипти, які виконуються повільно чи викликають помилки, Googlebot побачить порожню сторінку й проігнорує її.

Невідповідність канонічних сигналів: Google вирішив, що інша адреса є більш авторитетною, та вибрав її як канонічну замість поточної сторінки.

Ознаки Soft 404: сторінка формально повертає код 200, але виглядає як порожня, неактивна або повідомляє про відсутність товару.


Яку роль під час Crawling та Indexing відіграють robots.txt, meta robots і canonical?

robots.txt керує процесом сканування (Crawling). Він містить правила, які дозволяють або забороняють роботам завантажувати конкретні файли, папки чи сторінки. Якщо robots.txt забороняє доступ, Googlebot не зможе навіть завантажити вміст сторінки для аналізу.

meta robots (наприклад, тег noindex) керує процесом індексування (Indexing). Цей тег повідомляє пошуковому роботу, що сторінку не слід додавати до індексу та показувати у видачі, навіть якщо її було успішно скановано.

canonical (канонічний тег) допомагає впорядкувати сигнали ранжування для дубльованих чи схожих сторінок. Він вказує Google, яка саме адреса є пріоритетною для індексування, що запобігає марному витрачанню краулінгового бюджету на дублі.


Що означають статуси Discovered – currently not indexed та Crawled – currently not indexed у Google Search Console?

Discovered – currently not indexed (Знайдено — не проіндексовано): Google знає про існування URL-адреси, але ще не просканував її. Це вказує на проблеми з пріоритетом сканування, слабким внутрішнім лінкуванням чи перевантаженням сайту.

Crawled – currently not indexed (Проскановано — не проіндексовано): Google успішно відвідав і завантажив вміст сторінки, але ухвалив свідоме рішення не включати її до індексу. Це свідчить про проблему з якістю, унікальністю контенту або канонізацією.


Як за допомогою Google Search Console визначити, проблема сторінки пов'язана з Crawling чи з Indexing?

Перейдіть до звіту Page Indexing (Індексація сторінок) в лівому меню GSC.

Проаналізуйте причини, чому сторінки не індексуються:

Якщо сторінка застрягла у статусі "Discovered – currently not indexed", проблема криється на етапі Crawling (Google не пріоритезував сканування цього URL).

Якщо статус вказує на "Crawled – currently not indexed" або "Duplicate, submitted URL not canonical", проблема виникла на етапі Indexing (Google завантажив сторінку, але відхилив її через якість чи канонічність).

Скористайтеся інструментом URL Inspection (Перевірка URL) у самому верху панелі. Вставте URL та проаналізуйте розділ "Page indexing":

Crawl allowed?: чи не заблоковано сканування в robots.txt.

Page fetch: чи був успішним запит (код 200, 404 тощо).

Indexing allowed?: чи дозволено індексування кодом сторінки (тег noindex).

Google-selected canonical: який саме URL Google вважає головним (якщо він відрізняється від вашого варіанту, це проблема індексування через дублікати).


Які дії SEO-фахівець повинен виконати, якщо Google знаходить і сканує сторінку, але не додає її до індексу?

Якщо сторінка успішно сканується, але не індексується (статус Crawled – currently not indexed), технічних перешкод для бота немає, тож потрібно працювати над якістю та сигналами авторитетності сторінки:

Збільшити унікальність та цінність контенту: порівняйте сторінку з топовими результатами у пошуку. Збільште цінність тексту, додайте оригінальні приклади, дані, корисні таблиці чи медіафайли. Позбавтеся шаблонного тексту.

Перевірити канонізацію: переконайтеся, що ваші canonical-теги налаштовані правильно, немає конфліктів між HTTP/HTTPS чи версіями з trailing slash.

Підсилити внутрішнє перелінкування: додайте кілька контекстних посилань на цю сторінку з важливих та вже проіндексованих розділів чи головної сторінки вашого сайту.

Проаналізувати рендеринг JavaScript: запустіть Test Live URL (Перевірити активний URL) та перегляньте rendered HTML. Переконайтеся, що Googlebot бачить повний контент сторінки, а не пустий шаблон через повільні API-запити чи помилки у JS-скриптах.

Виключити soft 404: переконайтеся, що сторінка не виглядає порожньою чи недоступною.

Надіслати запит на переіндексацію: після реального покращення сторінки натисніть Request Indexing в інструменті URL Inspection. Робити це варто лише раз після оновлення.