ChatGPT на сервере чаще Googlebot: 34 дня логов и слепая зона аналитики

Если вы соло-разработчик и публикуете на VPS лендинг, pricing или технические посты про продукт с ИИ-углом, краулеры ассистентов могут обходить сайт чаще классического Googlebot — и при этом не попадать в GA4. Без сырых access logs картина «кто реально читает ваш контент для LLM» остаётся невидимой.
Live-fetch ассистентов обгоняет классический Googlebot
На малом бизнес-сайте в Израиле за 34 дня ChatGPT-User сделал 1 388 успешных запросов (40,3 в день) против 1 233 у Googlebot (35,8 в день) — это не SEO-абстракция, а измеримый сигнал.
В середине июля у автора кейса почти вдвое упали клики из Google Search Console по buyer-intent запросам на домашнем рынке. Вместо дашбордов он разобрал Caddy JSON access logs — и увидел «параллельную вселенную»: меньше трафика из поиска Google, зато постоянные обращения AI-систем. Ассистент запрашивал страницу примерно каждые 26 минут круглосуточно — потому что кто-то задал вопрос в чате.
Подсчёт вёлся только по ответам HTTP 200: без этого фильтра цифры завышались из‑за сканеров с подделанным User-Agent OpenAI и проб /wp-admin на сайте без WordPress. Классификация — regex по User-Agent; паттерны вроде ChatGPT-User и Claude-User должны матчиться раньше generic bot patterns.
| Бот | Запросов (34 дня) | В день | Роль |
|---|---|---|---|
| bingbot | 5 444 | 158,2 | Индекс Bing → питает ChatGPT |
| ChatGPT-User | 1 388 | 40,3 | Live fetch при вопросе к ChatGPT |
| Googlebot | 1 233 | 35,8 | Классический обход Google |
| GPTBot | 547 | 15,9 | Training crawler OpenAI |
| Claude-User | 519 | 15,1 | Live fetch при вопросе к Claude |
Bing обходил сайт примерно в 4,4 раза интенсивнее Google (158,2 vs 35,8 запросов в день). Если сгруппировать ботов по смыслу за те же 34 дня, live user retrieval (*-User) даёт ~1 907 запросов (~56/день), AI-search indexing — ~6 096 (~177/день), training crawls — ~897 (~26/день), классический Google — ~1 233 (~36/день).
Для разработчика, который выкладывает документацию API, гайды по MCP или pricing dev-продукта, live retrieval — это не «бот SEO», а ответ ассистента в момент вопроса пользователя. Страница становится источником в диалоге с LLM без участия автора.
Какие URL тянут ChatGPT, Claude и training-боты
Топ страниц у ChatGPT-User: homepage (115 запросов), гайд по WhatsApp automation (108), pricing guide WhatsApp-бота — люди спрашивают ChatGPT о стоимости бота, ассистент тянет pricing page.
У Claude-User картина другая: один пост про spam-detection собрал 233 из 519 запросов — 45% всего, что Claude читает на этом сайте. Один узкий технический материал может доминировать в выборке конкретного ассистента.
GPTBot в основном ходил на /signin и /forgot-password (по 12 визитов на login page). Perplexity-User за 34 дня не зафиксировал ни одного live retrieval; PerplexityBot индексировал (103 запроса), но live-fetch по запросу пользователя — ноль.
Практический вывод для соло-разработчика с self-hosted стеком: если вы пишете про агентов, API или rules для IDE, имеет смысл делать узкие single-topic страницы (один вопрос — глубокий ответ), а не pillar pages с дюжиной поверхностных блоков. Кейс Claude и spam-detection post это иллюстрирует.
Почему GA4 не видит 8 900 AI-запросов
Автор сверял Google Analytics 4 с двумя независимыми способами за 11 дней: ~780 реальных browser visitors в логах и widget-loads против 89 в GA4. Только ~11% посетителей принимали cookie banner — GA4 недосчитывал людей примерно в 9 раз.
AI-запросы усугубляют картину: они не выполняют JavaScript, не кликают consent banner и не генерируют pageview. 8 900 AI-related запросов за период наблюдения не попали в GA4. На сайте при этом ~70 реальных посетителей в день — AI-активность сопоставима по масштабу с человеческим трафиком, но в привычной аналитике её нет.
Без raw access logs на хостинге решения про контент, robots.txt или приоритеты страниц принимаются «вслепую» относительно значимой доли аудитории — в том числе той, что читает ваши dev-материалы через ассистентов.
Измерение в кейсе — не дашборд IDE, а ~60 строк Python поверх Caddy JSON access logs. Паттерн доступен любому соло на VPS: не нужен отдельный SaaS для первичной диагностики.
Что автор меняет в работе с контентом
Три практики из поста, переносимые на dev-контент:
- Еженедельно смотреть агентов
*-User(live retrievals = pipeline цитирований), а не ежедневные rankings в Search Console. - Bing Webmaster Tools — автор впервые ставит в приоритет и ссылается на данные Seer Interactive: 87% цитат SearchGPT совпадают с топом Bing organic (56% для Google). URL исследования в посте не указан — цифры передаём с его атрибуцией.
- Писать узкие single-topic страницы вместо «столпов» с множеством поверхностных ответов.
В первоисточнике не разобраны настройки robots.txt, rate limiting, блокировка training crawlers (GPTBot, ClaudeBot) или отдельные CDN-правила. Если вы сознательно закрываете training-ботов, это отдельное решение — кейс его не документирует.
Источники
- I Logged Every AI Crawler for 34 Days. ChatGPT Outreads Googlebot — Dev.to,
@achiya-automation, дата доступа: 2026-08-16