Як перевірити, чи запит до сервера справді зробив Googlebot?


1. Чому одного User-Agent Googlebot недостатньо, щоб довести, що запит справді зробив Google?
Самодекларування: Рядок User-Agent надсилається самим клієнтом, є неперевіреним і базується лише на довірі до того, що клієнт пише про себе.
Легкість підробки (Spoofing): Зловмисні боти, автоматичні парсери (scrapers) та інструменти навантажувального тестування масово підробляють User-Agent під Googlebot, щоб прослизнути повз фільтри безпеки та безперешкодно збирати дані.
Тривіальність налаштування: Змінити цей рядок у запиті надзвичайно просто — це робиться в один клік через налаштування розробника в браузері, спеціальні розширення, командний рядок або за допомогою будь-якої HTTP-бібліотеки в коді. Через це покладатися суто на рядок User-Agent у безпекових рішеннях категорично заборонено.
2. Які дані про запит Googlebot можна побачити в server logs?
Журнали сервера (server logs) фіксують абсолютно кожне звернення до вашого сайту. Для кожного запиту Googlebot ви можете побачити:
IP-адресу відправника;
Точну часову мітку (timestamp);
Запитувану URL-адресу (включаючи параметри запиту);
HTTP-код відповіді сервера (статус-коди 200, 301, 404, 500 тощо);
Повний рядок User-Agent;
Час відповіді сервера на запит (response time);
Розмір переданих даних у байтах;
Referrer (інформацію про джерело переходу, якщо воно зафіксувалося).
3. Що таке reverse DNS lookup і як він використовується для перевірки Googlebot?
Reverse DNS lookup (зворотний DNS-запит) — це мережева операція, яка дозволяє визначити доменне ім'я (хост) сервера, якому належить конкретна IP-адреса, що зафіксована у ваших логах. У процесі перевірки системний адміністратор або SEO-фахівець бере IP-адресу підозрілого запиту з логів і виконує для неї зворотний DNS-запит за допомогою консольних утиліт (наприклад, команди host), щоб побачити, на який саме домен вказує ця адреса.
4. Які домени повинні повертатися під час reverse DNS перевірки справжнього Googlebot?
Під час зворотного DNS-запиту IP-адреса справжнього робота Google повинна резолвитися в доменне ім'я, яке закінчується виключно на:
googlebot.com;
google.com;
googleusercontent.com.
Типові приклади легітимних хостів:
crawl-***-***-***-***.googlebot.com (основні пошукові роботи);
geo-crawl-***-***-***-***.geo.googlebot.com (роботи з урахуванням геолокації);
rate-limited-proxy-***-***-***-***.google.com (спеціальні сканери);
***-***-***-***.gae.googleusercontent.com (запити користувачів через хмарну інфраструктуру Google).
5. Навіщо після reverse DNS потрібно робити forward DNS lookup?
Будь-який зловмисник, що володіє власним сервером та IP-адресою, може прописати у своїх PTR-записах фейкове ім'я хоста (наприклад, написати, що його IP веде на crawl.googlebot.com). Щоб запобігти такому обману, обов'язково виконують другий крок — Forward DNS lookup (прямий DNS-запит). Ви робите запит до отриманого доменного імені, щоб дізнатися його IP. Оскільки зоною googlebot.com керує виключно компанія Google, шахрай не зможе підробити запис на офіційних серверах імен Google. Якщо прямий запит підтвердить ту саму IP, з якої прийшов бот — він легітимний.
6. Як перевірити, що отримана IP-адреса після forward lookup збігається з початковою IP-адресою запиту?
Процес перевірки виконується за таким двокроковим алгоритмом:
Зворотний запит: Виконуємо команду host для IP з логів (наприклад, host 66.249.66.1). Отримуємо доменне ім'я: crawl-66-249-66-1.googlebot.com..
Прямий запит: Беремо це ім'я хоста і робимо прямий DNS-запит: host crawl-66-249-66-1.googlebot.com.
Зіставлення: Перевіряємо відповідь системи. Вона має повернути адресу 66.249.66.1. Оскільки фінальна IP повністю збігається з вихідною IP-адресою запиту з логів — перевірку пройдено успішно.
7. Як використовувати офіційні списки IP-діапазонів Google для перевірки crawler-запитів?
JSON-файли списків: Google офіційно публікує списки IP-діапазонів для своїх роботів у CIDR-нотації. Основні пошукові роботи (включаючи Googlebot) описані у файлі common-crawlers.json, який Google переніс на новий шлях /crawling/ipranges/ у березні 2026 року.
Щоденне оновлення: Google оновлює списки IP-адрес у цих JSON-файлах щоденно (раніше це відбувалося щотижня) для зручності великих мережевих операторів.
Автоматичне зіставлення: Замість повільних DNS-запитів на кожен HTTP-запит, вебсервер (наприклад, Nginx) може автоматично завантажувати ці JSON-файли, конвертувати префікси та миттєво порівнювати IP-адресу клієнта з дозволеним списком діапазонів у фоновому режимі.
8. Чим справжній Googlebot відрізняється від ботів, які просто підробляють його User-Agent?
Критерій порівнянняСправжній GooglebotФальшивий Googlebot (Spoofed Bot)
IP-адреса та хост
Належить до офіційних діапазонів Google, успішно проходить двосторонню верифікацію через DNS.
Походить із випадкових діапазонів комерційних провайдерів (consumer ISP) або сторонніх хостингів.
Поведінка сканування
Сканує помірно, поважає правила robots.txt, знижує швидкість обходу, якщо сервер сайту уповільнюється чи повертає помилки 500.
Обходить дорогі динамічні адреси та комбінації фільтрів на максимальній швидкості, провокуючи помилки сервера 504 та падіння сайту.
Ціль візиту
Дослідження структури сайту та збір інформації для пошукового індексу Google.
Конкурентна розвідка, несанкціоноване копіювання контенту (scraping) або спроби злому (наприклад, підбір паролів WordPress).
9. Як SEO-фахівець може масово аналізувати Googlebot у логах сервера?
Для масового аналізу мільйонів запитів у важких файлах логів застосовують такі інструменти:
Спеціалізовані лог-аналізатори: Використовують десктопний софт, наприклад Screaming Frog Log File Analyzer (SFLA), який містить автоматичну функцію детекції та верифікації пошукових роботів («verify bots»).
Python-скрипти: Створюють власні скрипти для фільтрації запитів за User-Agent та масового порівняння IP із завантаженим JSON-списком діапазонів Google.
Рішення на рівні вебсервера (Nginx/CDN): Налаштовують geo-блоки в конфігурації Nginx. Вони компілюють дозволені IP-діапазони у дерево radix на етапі запуску сервера, що гарантує перевірку кожного клієнта за мікросекунди без навантаження на систему. Також залучають захисні механізми CDN (як-от Cloudflare).
10. Чому правильна перевірка Googlebot важлива для log analysis, безпеки сайту та діагностики Crawling?
Безпека та стабільність сервера: Запобігає падінню сервера та появі помилок з'єднання. Шкідливі боти, що імітують Googlebot, створюють величезне паралельне навантаження, яке уповільнює сайт для живих відвідувачів та реальних пошукових павуків. Блокування rogue-IP убезпечує сайт від DDOS-навантажень та спроб злому.
Точність SEO-аналітики (Log Analysis): Без очищення логів від фейків ваші висновки будуть викривленими. Наприклад, ви можете побачити помилковий сплеск сканування неіснуючих сторінок, який насправді згенерували спам-боти, а не Google.
Діагностика Crawling: Справжня перевірка дозволяє відокремити аномалії від технічних SEO-помилок. Якщо реальний Googlebot масово сканує дивні 404-сторінки — це ознака серйозного збою в коді JavaScript сайту, який потрібно терміново усунути розробникам.
Захист від помилок блокування: Просте блокування за словом "Googlebot" у юзер-агенті закриє доступ реальному роботу, що повністю знищить видимість вашого сайту в пошуку Google. Верифікація дозволяє точково відсікати шкідливий трафік, не зачіпаючи пошукову індексацію.
Продовжуйте навчання
Останні матеріали цього курсу

Що показують серверні логи про Googlebot? Пояснюємо основи Log File Analysis, виявлення проблем із краулінгом та аналіз статусу сторінок.

Дізнайтеся, як Googlebot обробляє JavaScript-сайти. Що таке рендеринг на стороні сервера і клієнта, та чому JS може заважати скануванню та індексації.

Для яких сайтів Crawl Budget має значення? Пояснюємо, чому малим ресурсам він не важливий, а гіганти екоммерсу втрачають через нього трафік.

Дізнайтеся, як Google витрачає краулінговий бюджет на вашому сайті. Які фактори впливають на швидкість та частоту сканування сторінок роботом.
Обговорення та запитання (0)
Поки що тут немає запитань або коментарів. Будьте першим, хто розпочне обговорення.