Перейти к контенту
AI и LLM

Приводит ли ChatGPT клиентов на сайт: как измерить это по логам

Ни Метрика, ни Search Console не отвечают на вопрос, ходят ли к вам ИИ-боты. Ответ есть только в access-логах. Разбор на реальных цифрах: 431 загрузка ИИ-ботами против 84 у Googlebot и две ловушки, которые завышают результат в семь раз.

Автор: Николай Мазур · · 9 мин чтения · Read in English

Короткий ответ: проверить это можно только по access-логам веб-сервера — ни Яндекс.Метрика, ни Google Search Console на такой вопрос не отвечают. Метрика не считает ботов вовсе, Search Console показывает Google, Вебмастер — Яндекс. Нужно искать в логах агенты GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, а переходы живых людей — по метке utm_source=chatgpt.com. И считать только успешные ответы: иначе цифра завышается в семь раз.

Мы разобрали логи собственного сайта за 15 дней и получили картину, которой не нашли ни в одном русском материале по теме. Ниже — и метод, и цифры, включая неудобные.

Почему ни один кабинет не отвечает на этот вопрос

Разберём по инструментам, потому что многие ищут ответ не там:

  • Яндекс.Метрика считает людей, а не роботов. Счётчик — это JavaScript на странице, а ИИ-боты скрипты не исполняют. В Метрике их нет и не будет.
  • Google Search Console показывает только Googlebot и только выдачу Google.
  • Яндекс.Вебмастер — только Яндекс.
  • Bing Webmaster Tools с недавних пор показывает раздел AI Performance, но считает он цитирования в продуктах Microsoft — Copilot и партнёры. К ChatGPT это отношения не имеет.

Остаётся сервер. Он записывает каждое обращение вместе с User-Agent и Referer — и это единственное место, где видно и ботов, и переходы людей.

Ловушка первая: логов обычно два, и нужен не тот, что первым попадётся

Первое, на чём мы сами споткнулись. В типовой конфигурации nginx есть общий /var/log/nginx/access.log и отдельный лог виртуального хоста.

Общий у нас оказался логом редирект-хоста http → https: 50 630 записей, из них 100% с кодом 301 и ни одной с кодом 200. Делать выводы по нему бессмысленно — там не посещения, а перенаправления и мусор сканеров.

Настоящий лог сайта назывался mzrdigital.access.log. Прежде чем считать, проверьте, что в файле вообще есть ответы 200:

awk '{print $9}' /var/log/nginx/access.log | sort | uniq -c | sort -rn | head

Если в топе только 301 — вы читаете не тот файл.

Ловушка вторая: сканеры подставляют себе агенты ИИ-ботов

Это главное, из-за чего чужим цифрам по теме верить не стоит.

В нашем логе нашлось 3015 строк с агентами вида GPTBot и ClaudeBot. Красивое число. Но если посмотреть коды ответов, выясняется, что 2572 из них — это 404, и запрашивали они вот что:

/fetch  /proxy  /.env  /@fs/etc/passwd  /api/webhook  /actuator

Это сканеры уязвимостей, которые подставили себе популярный User-Agent, чтобы пройти мимо простых фильтров. Настоящих обращений осталось 435 — в семь раз меньше.

Тот же приём мы увидели и с «Googlebot»: 35 703 строки с 21 адреса, все с кодом 301, все на /.env и /.git/index.

Правило: считайте только успешные ответы (200 и 304). Заодно полезно смотреть на адреса — у настоящих ботов OpenAI и Perplexity это узнаваемые диапазоны, а не один хост, долбящийся в /.env.

Что показали наши логи за 15 дней

Период — 5–19 сентября 2026 года. Только успешные ответы.

Боты, которые ходят сами:

АгентЗагрузок
ClaudeBot153
PerplexityBot104
GPTBot39
OAI-SearchBot31
Amazonbot15
meta-externalagent1
Итого343

Боты, которые открыли страницу, потому что человек прямо сейчас задал вопрос ассистенту: ChatGPT-User — 81, Claude-User — 6, Perplexity-User — 1. Итого 88 обращений, около шести в день.

Разница между двумя группами принципиальная. Первая — обход для индекса. Вторая — это уже разговор с живым человеком: кто-то спросил, ассистент пошёл читать вашу страницу, чтобы ответить.

Для сравнения, обычные поисковики за те же 15 дней: Bingbot — 218, Яндекс — 201, Googlebot — 84.

То есть ИИ-боты забрали наши страницы в пять раз чаще, чем Googlebot — 431 против 84.

Живые люди из ChatGPT: три визита, о которых стоит поговорить

ChatGPT помечает переходы меткой utm_source=chatgpt.com, поэтому их видно и в логах, и в Метрике.

За 15 дней их было три — 7, 9 и 14 сентября. Пришли на разбор стоимости RAG-системы, на главную и на страницу оферты.

Метрика показала то, чего в логах нет: 3 минуты 23 секунды на сайте и ноль отказов. Для сравнения, у пяти посетителей из Google за тот же период — пять запросов на всех, то есть заглянули и ушли.

И ещё одна цифра, которая нам самим не понравилась: по уникальным посетителям за 15 дней Google — 5, ChatGPT — 4, DuckDuckGo — 2, Яндекс — 1.

Чего эти цифры НЕ значат

Здесь надо быть честным, иначе получится реклама вместо разбора.

Три визита — это мало. У сайта пока небольшая посещаемость, и говорить «ChatGPT приводит клиентов» на таких числах нельзя. Ценность не в объёме, а в двух вещах: канал существует и он измерим, а соотношения — 431 против 84, 3 минуты против 20 секунд — от объёма не зависят.

«Индекс Bing питает ChatGPT» — у нас не подтвердилось. Это популярное утверждение, мы сами им пользовались. После подключения Bing Webmaster оказалось: в разделе AI Performance за три месяца ноль цитирований по линии Microsoft Copilots. При этом ChatGPT ходит к нам своими краулерами десятками раз. Вывод: это разные каналы, и наличие сайта в Bing ничего не говорит о его видимости для ChatGPT.

llms.txt за 15 дней не запросил ни один агент. Ни разу. При этом sitemap-index.xml краулеры ИИ забирали 168 раз — это их основной вход на сайт. Файл llms.txt не вредит, но считать его рабочим каналом сегодня оснований нет: решает обычный HTML и карта сайта.

Как повторить это у себя

Минимальный вариант — одна команда. Замените путь на свой лог:

grep -E 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|PerplexityBot' \
  /var/log/nginx/site.access.log \
  | awk '$9 == 200 || $9 == 304' \
  | grep -oE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|PerplexityBot' \
  | sort | uniq -c | sort -rn

Фильтр $9 == 200 — это и есть защита от той самой семикратной ошибки.

Переходы живых людей ищутся отдельно:

grep -c 'utm_source=chatgpt' /var/log/nginx/site.access.log

Если логи лежат в ротации и часть из них в gzip, удобнее разбирать их скриптом, который сам раскладывает агентов по группам, отбрасывает подделки и показывает, какие страницы забирали. Мы такой написали для себя — он читает и обычные файлы, и .gz, и печатает сводку целиком.

Отдельно стоит проверить, а пускаете ли вы этих ботов вообще: если в robots.txt стоит Disallow: / для GPTBot, никакого канала не будет независимо от качества текста. Это, а заодно видимость текста без JavaScript, можно проверить нашим бесплатным инструментом — он ничего не просит и работает с любым сайтом.

Что со всем этим делать

Три практических вывода из наших же данных.

Целиться в главную. Из 88 обращений «по живому вопросу» 75 пришлись на главную страницу. Ассистента спрашивают не про статью, а про компанию: кто это, что делает, сколько стоит, где находится. Значит короткие самодостаточные ответы нужны прежде всего там, а не в глубине блога.

Писать про деньги и сроки. Из внутренних страниц ассистенты чаще всего открывали два материала — про стоимость RAG-системы и про бюджет локальной LLM. У ассистентов спрашивают «сколько это стоит», а не «что такое RAG».

Мерить регулярно, а не однажды. Канал новый, он меняется. Мы теперь снимаем эти цифры раз в две недели вместе с выгрузкой запросов из поисковых кабинетов.


Мы в MZR Digital делаем AI-ассистентов на локальных LLM и RAG по корпоративным документам. Этот разбор — побочный результат работы над собственным сайтом: сначала понадобилось ответить на вопрос «а работает ли вообще этот канал», потом выяснилось, что ответа нет ни в одном кабинете.

Похожая задача в вашем бизнесе?

За 60 минут разберём вашу задачу, покажем архитектуру и оценим бюджет.