Перейти к контенту
Собственный замер, 2026-09-29

llms.txt: кто его делает и кто читает

Файл llms.txt считается способом объяснить себя ИИ-ассистентам. Мы измерили обе стороны: сколько сайтов его сделали и сколько раз его кто-нибудь забрал.

Короткий ответ: файл есть у 17,2% проверенных сайтов, сделан он аккуратно и вручную, а приходят за ним SEO-сканеры, каталоги технологий и люди из браузера. ИИ-агентов среди них не было ни одного.

Сколько сайтов его сделали

Выборка — 285 доменов студий разработки из рейтинга веб-разработки. Проверка идёт тем же кодом, что работает в нашем инструменте.

Проверено сайтов 285
Настоящий llms.txt 49 (17,2%)
Отдают HTML-страницу под этим адресом 13

Ловушка, на которой мы сами ошиблись. Первый замер насчитал 62 сайтов с файлом, и эта цифра (21,8%) успела попасть к нам на страницу инструмента. Проверка «код 200 и непустой ответ» считает файлом и обычную HTML-страницу 404, которую сервер отдаёт с кодом 200. После отсева осталось 49. Если будете мерить сами — отсеивайте ответы, начинающиеся с <!doctype.

Файлы сделаны всерьёз

Это самая неожиданная часть замера. Легко было предположить, что файл ставят «на всякий случай» и заполняют мусором. Ничего подобного.

Что проверяли Из 49 файлов
Соответствует спецификации целиком 37 (75,5%)
Есть заголовок первого уровня 45 (91,8%)
Есть краткое описание цитатой 37 (75,5%)
Разбит на разделы 45 (91,8%)
Ни одной ссылки внутри 10 (20,4%)

Медиана — 8 519 байт, 85 строк и 19 ссылок. Это не формальная отписка, а полчаса-час работы на каждый файл.

И решающая деталь: одинаковых файлов на разных доменах не нашлось ни одного. Мы сравнивали содержимое по отпечатку, приведя пробелы к одному виду. Значит это не вывод общего плагина — каждый файл писали руками.

Кто за ним приходит

Вторая половина замера — наши собственные access-логи за 15 дней, 23 957 строк. Всего обращений к /llms.txt — 27, из них 8 наших собственных (инструмент и проверки). Остаётся 19.

Кто забирал Обращений
браузер (человек) 8
yacybot 3
BuiltWith 2
agentcensus-crawler 1
SERankingBacklinksBot 1
Baiduspider 1
DropMonBot 1
Dataprovider.com 1
SeoScannerBot 1
Из них ИИ-агентов 0

Искали GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Google-Extended, CCBot, Applebot-Extended, Bytespider и ещё несколько. Ни один из них за файлом не пришёл ни разу.

Для сравнения, в том же окне и том же логе sitemap запросили 656 раз. Разница не в разы, а на два порядка.

Чего эти цифры не доказывают

  • Логи одного маленького сайта. 15 дней и 23 957 строк. На сайте с другой аудиторией картина может быть другой. Это наблюдение, а не закон.
  • Мы не видим robots.txt. У его location в nginx стоял access_log off, и обращения к нему в лог не попадали вовсе. Нашли это, готовя материал. Поэтому сравниваем с sitemap, а не с robots.txt — хотя сравнение с robots.txt было бы честнее.
  • Отсутствие запроса не равно бесполезности. Ассистент может знать содержимое файла из индекса поисковика, не запрашивая его напрямую. Мы меряем обращения, а не влияние.
  • Выборка смещена в сильную сторону. Это агентства из рейтинга, то есть те, кто своим присутствием занимается. По рынку в целом доля файлов будет ниже.
  • Завтра это может измениться. Спецификации меньше двух лет. Если агенты начнут читать файл, замер устареет — и мы его повторим.

Что с этим делать

Если файла нет — не спешите. Полчаса работы лучше потратить на то, что агенты действительно забирают: sitemap, доступ в robots.txt и текст, который виден без JavaScript. По нашему замеру рынка директивы Sitemap нет у 12,9% сайтов, а фрагмента, который модель может процитировать целиком, нет у 56,3%. Это дешевле и точно работает.

Если файл уже есть — не удаляйте. Он не вредит, стоит ноль в обслуживании, и если агенты за ним придут, вы будете готовы. Просто не ждите от него трафика сегодня.

И не верьте отчётам, где рост обращений к llms.txt выдают за интерес ассистентов. Судя по нашему логу, это приходят каталоги технологий и SEO-сканеры — они обходят файл именно потому, что о нём много пишут.

Частые вопросы

Что такое llms.txt?

llms.txt — это текстовый файл в корне сайта, который по замыслу авторов спецификации llmstxt.org описывает языковой модели структуру сайта: заголовок, краткое описание и разделы со ссылками на главные страницы. Идея та же, что у robots.txt и sitemap.xml, только адресат — ассистент, а не поисковый робот.

Нужен ли сайту llms.txt?

По нашим измерениям сегодня — почти нет. За 15 дней файл забрали с нашего сайта 27 раз, и ни одного раза это не был ИИ-агент: приходили SEO-сканеры, каталоги технологий и люди из браузера. Sitemap за то же время запросили 656 раз. Файл не вредит и стоит получаса, но считать его каналом попадания в ответы ассистентов оснований нет.

Сколько сайтов уже сделали llms.txt?

В нашей выборке из 285 сайтов студий разработки настоящий файл нашёлся у 49, это 17,2%. Важная поправка: наивная проверка «код 200 и непустой ответ» даёт 62 сайтов, потому что 13 из них отдают под этим адресом свою HTML-страницу 404. Мы на этом сами один раз ошиблись.

Файлы делают формально или всерьёз?

Всерьёз. Спецификации llmstxt.org соответствуют 75,5% файлов: есть заголовок, разделы и ссылки в markdown. Медиана — 8 519 байт и 19 ссылок. Одинаковых файлов на разных доменах не нашлось ни одного, то есть это ручная работа, а не вывод плагина.

Как проверить это на своём сайте?

По access-логам веб-сервера: искать строки с GET /llms.txt и смотреть User-Agent. Две ловушки. Первая: в общем access.log может лежать только редирект-хост http→https — нужен лог конкретного виртуального хоста. Вторая: сканеры уязвимостей подставляют себе User-Agent ИИ-ботов, поэтому считать надо только успешные ответы.

Как это воспроизвести

Обе половины замера делаются скриптами, а не руками, и выборка лежит файлом — иначе повторить результат нельзя, а значит и верить ему не за что. Сайтовая часть: собрать выборку, затем прогнать по ней проверку содержимого. Логовая часть: забрать access-логи и разобрать обращения по User-Agent, считая только успешные ответы.

Проверить свой сайт по тем же правилам можно в бесплатном инструменте — он ничего не просит и показывает результат на фоне 279 сайтов студий.