Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 16 августа 2026 г.

Разборы

ChatGPT на сервере чаще Googlebot: 34 дня логов и слепая зона аналитики

ChatGPT на сервере чаще Googlebot: 34 дня логов и слепая зона аналитики

Если вы соло-разработчик и публикуете на VPS лендинг, pricing или технические посты про продукт с ИИ-углом, краулеры ассистентов могут обходить сайт чаще классического Googlebot — и при этом не попадать в GA4. Без сырых access logs картина «кто реально читает ваш контент для LLM» остаётся невидимой.

Live-fetch ассистентов обгоняет классический Googlebot

На малом бизнес-сайте в Израиле за 34 дня ChatGPT-User сделал 1 388 успешных запросов (40,3 в день) против 1 233 у Googlebot (35,8 в день) — это не SEO-абстракция, а измеримый сигнал.

В середине июля у автора кейса почти вдвое упали клики из Google Search Console по buyer-intent запросам на домашнем рынке. Вместо дашбордов он разобрал Caddy JSON access logs — и увидел «параллельную вселенную»: меньше трафика из поиска Google, зато постоянные обращения AI-систем. Ассистент запрашивал страницу примерно каждые 26 минут круглосуточно — потому что кто-то задал вопрос в чате.

Подсчёт вёлся только по ответам HTTP 200: без этого фильтра цифры завышались из‑за сканеров с подделанным User-Agent OpenAI и проб /wp-admin на сайте без WordPress. Классификация — regex по User-Agent; паттерны вроде ChatGPT-User и Claude-User должны матчиться раньше generic bot patterns.

Бот Запросов (34 дня) В день Роль
bingbot 5 444 158,2 Индекс Bing → питает ChatGPT
ChatGPT-User 1 388 40,3 Live fetch при вопросе к ChatGPT
Googlebot 1 233 35,8 Классический обход Google
GPTBot 547 15,9 Training crawler OpenAI
Claude-User 519 15,1 Live fetch при вопросе к Claude

Bing обходил сайт примерно в 4,4 раза интенсивнее Google (158,2 vs 35,8 запросов в день). Если сгруппировать ботов по смыслу за те же 34 дня, live user retrieval (*-User) даёт ~1 907 запросов (~56/день), AI-search indexing — ~6 096 (~177/день), training crawls — ~897 (~26/день), классический Google — ~1 233 (~36/день).

Для разработчика, который выкладывает документацию API, гайды по MCP или pricing dev-продукта, live retrieval — это не «бот SEO», а ответ ассистента в момент вопроса пользователя. Страница становится источником в диалоге с LLM без участия автора.

Какие URL тянут ChatGPT, Claude и training-боты

Топ страниц у ChatGPT-User: homepage (115 запросов), гайд по WhatsApp automation (108), pricing guide WhatsApp-бота — люди спрашивают ChatGPT о стоимости бота, ассистент тянет pricing page.

У Claude-User картина другая: один пост про spam-detection собрал 233 из 519 запросов — 45% всего, что Claude читает на этом сайте. Один узкий технический материал может доминировать в выборке конкретного ассистента.

GPTBot в основном ходил на /signin и /forgot-password (по 12 визитов на login page). Perplexity-User за 34 дня не зафиксировал ни одного live retrieval; PerplexityBot индексировал (103 запроса), но live-fetch по запросу пользователя — ноль.

Практический вывод для соло-разработчика с self-hosted стеком: если вы пишете про агентов, API или rules для IDE, имеет смысл делать узкие single-topic страницы (один вопрос — глубокий ответ), а не pillar pages с дюжиной поверхностных блоков. Кейс Claude и spam-detection post это иллюстрирует.

Почему GA4 не видит 8 900 AI-запросов

Автор сверял Google Analytics 4 с двумя независимыми способами за 11 дней: ~780 реальных browser visitors в логах и widget-loads против 89 в GA4. Только ~11% посетителей принимали cookie banner — GA4 недосчитывал людей примерно в 9 раз.

AI-запросы усугубляют картину: они не выполняют JavaScript, не кликают consent banner и не генерируют pageview. 8 900 AI-related запросов за период наблюдения не попали в GA4. На сайте при этом ~70 реальных посетителей в день — AI-активность сопоставима по масштабу с человеческим трафиком, но в привычной аналитике её нет.

Без raw access logs на хостинге решения про контент, robots.txt или приоритеты страниц принимаются «вслепую» относительно значимой доли аудитории — в том числе той, что читает ваши dev-материалы через ассистентов.

Измерение в кейсе — не дашборд IDE, а ~60 строк Python поверх Caddy JSON access logs. Паттерн доступен любому соло на VPS: не нужен отдельный SaaS для первичной диагностики.

Что автор меняет в работе с контентом

Три практики из поста, переносимые на dev-контент:

  1. Еженедельно смотреть агентов *-User (live retrievals = pipeline цитирований), а не ежедневные rankings в Search Console.
  2. Bing Webmaster Tools — автор впервые ставит в приоритет и ссылается на данные Seer Interactive: 87% цитат SearchGPT совпадают с топом Bing organic (56% для Google). URL исследования в посте не указан — цифры передаём с его атрибуцией.
  3. Писать узкие single-topic страницы вместо «столпов» с множеством поверхностных ответов.

В первоисточнике не разобраны настройки robots.txt, rate limiting, блокировка training crawlers (GPTBot, ClaudeBot) или отдельные CDN-правила. Если вы сознательно закрываете training-ботов, это отдельное решение — кейс его не документирует.


Источники