llms.txt: кто его делает и кто читает
Файл llms.txt считается способом объяснить
себя ИИ-ассистентам. Мы измерили обе стороны: сколько сайтов его сделали
и сколько раз его кто-нибудь забрал.
Короткий ответ: файл есть у 17,2% проверенных сайтов, сделан он аккуратно и вручную, а приходят за ним SEO-сканеры, каталоги технологий и люди из браузера. ИИ-агентов среди них не было ни одного.
Сколько сайтов его сделали
Выборка — 285 доменов студий разработки из рейтинга веб-разработки. Проверка идёт тем же кодом, что работает в нашем инструменте.
| Проверено сайтов | 285 |
| Настоящий llms.txt | 49 (17,2%) |
| Отдают HTML-страницу под этим адресом | 13 |
Ловушка, на которой мы сами ошиблись.
Первый замер насчитал 62 сайтов с файлом, и эта цифра
(21,8%) успела попасть к нам на страницу
инструмента. Проверка «код 200 и непустой ответ» считает файлом
и обычную HTML-страницу 404, которую сервер отдаёт с кодом 200.
После отсева осталось 49. Если будете мерить сами — отсеивайте
ответы, начинающиеся с <!doctype.
Файлы сделаны всерьёз
Это самая неожиданная часть замера. Легко было предположить, что файл ставят «на всякий случай» и заполняют мусором. Ничего подобного.
| Что проверяли | Из 49 файлов |
|---|---|
| Соответствует спецификации целиком | 37 (75,5%) |
| Есть заголовок первого уровня | 45 (91,8%) |
| Есть краткое описание цитатой | 37 (75,5%) |
| Разбит на разделы | 45 (91,8%) |
| Ни одной ссылки внутри | 10 (20,4%) |
Медиана — 8 519 байт, 85 строк и 19 ссылок. Это не формальная отписка, а полчаса-час работы на каждый файл.
И решающая деталь: одинаковых файлов на разных доменах не нашлось ни одного. Мы сравнивали содержимое по отпечатку, приведя пробелы к одному виду. Значит это не вывод общего плагина — каждый файл писали руками.
Кто за ним приходит
Вторая половина замера — наши собственные access-логи
за 15 дней, 23 957 строк.
Всего обращений к /llms.txt —
27, из них 8 наших собственных
(инструмент и проверки). Остаётся 19.
| Кто забирал | Обращений |
|---|---|
| браузер (человек) | 8 |
| yacybot | 3 |
| BuiltWith | 2 |
| agentcensus-crawler | 1 |
| SERankingBacklinksBot | 1 |
| Baiduspider | 1 |
| DropMonBot | 1 |
| Dataprovider.com | 1 |
| SeoScannerBot | 1 |
| Из них ИИ-агентов | 0 |
Искали GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Google-Extended, CCBot, Applebot-Extended, Bytespider и ещё несколько. Ни один из них за файлом не пришёл ни разу.
Для сравнения, в том же окне и том же логе sitemap запросили 656 раз. Разница не в разы, а на два порядка.
Чего эти цифры не доказывают
- Логи одного маленького сайта. 15 дней и 23 957 строк. На сайте с другой аудиторией картина может быть другой. Это наблюдение, а не закон.
- Мы не видим robots.txt. У его
location в nginx стоял
access_log off, и обращения к нему в лог не попадали вовсе. Нашли это, готовя материал. Поэтому сравниваем с sitemap, а не с robots.txt — хотя сравнение с robots.txt было бы честнее. - Отсутствие запроса не равно бесполезности. Ассистент может знать содержимое файла из индекса поисковика, не запрашивая его напрямую. Мы меряем обращения, а не влияние.
- Выборка смещена в сильную сторону. Это агентства из рейтинга, то есть те, кто своим присутствием занимается. По рынку в целом доля файлов будет ниже.
- Завтра это может измениться. Спецификации меньше двух лет. Если агенты начнут читать файл, замер устареет — и мы его повторим.
Что с этим делать
Если файла нет — не спешите. Полчаса работы лучше потратить на то, что агенты действительно забирают: sitemap, доступ в robots.txt и текст, который виден без JavaScript. По нашему замеру рынка директивы Sitemap нет у 12,9% сайтов, а фрагмента, который модель может процитировать целиком, нет у 56,3%. Это дешевле и точно работает.
Если файл уже есть — не удаляйте. Он не вредит, стоит ноль в обслуживании, и если агенты за ним придут, вы будете готовы. Просто не ждите от него трафика сегодня.
И не верьте отчётам, где рост обращений к llms.txt выдают за интерес ассистентов. Судя по нашему логу, это приходят каталоги технологий и SEO-сканеры — они обходят файл именно потому, что о нём много пишут.
Частые вопросы
Что такое llms.txt?
llms.txt — это текстовый файл в корне сайта, который по замыслу авторов спецификации llmstxt.org описывает языковой модели структуру сайта: заголовок, краткое описание и разделы со ссылками на главные страницы. Идея та же, что у robots.txt и sitemap.xml, только адресат — ассистент, а не поисковый робот.
Нужен ли сайту llms.txt?
По нашим измерениям сегодня — почти нет. За 15 дней файл забрали с нашего сайта 27 раз, и ни одного раза это не был ИИ-агент: приходили SEO-сканеры, каталоги технологий и люди из браузера. Sitemap за то же время запросили 656 раз. Файл не вредит и стоит получаса, но считать его каналом попадания в ответы ассистентов оснований нет.
Сколько сайтов уже сделали llms.txt?
В нашей выборке из 285 сайтов студий разработки настоящий файл нашёлся у 49, это 17,2%. Важная поправка: наивная проверка «код 200 и непустой ответ» даёт 62 сайтов, потому что 13 из них отдают под этим адресом свою HTML-страницу 404. Мы на этом сами один раз ошиблись.
Файлы делают формально или всерьёз?
Всерьёз. Спецификации llmstxt.org соответствуют 75,5% файлов: есть заголовок, разделы и ссылки в markdown. Медиана — 8 519 байт и 19 ссылок. Одинаковых файлов на разных доменах не нашлось ни одного, то есть это ручная работа, а не вывод плагина.
Как проверить это на своём сайте?
По access-логам веб-сервера: искать строки с GET /llms.txt и смотреть User-Agent. Две ловушки. Первая: в общем access.log может лежать только редирект-хост http→https — нужен лог конкретного виртуального хоста. Вторая: сканеры уязвимостей подставляют себе User-Agent ИИ-ботов, поэтому считать надо только успешные ответы.
Как это воспроизвести
Обе половины замера делаются скриптами, а не руками, и выборка лежит файлом — иначе повторить результат нельзя, а значит и верить ему не за что. Сайтовая часть: собрать выборку, затем прогнать по ней проверку содержимого. Логовая часть: забрать access-логи и разобрать обращения по User-Agent, считая только успешные ответы.
Проверить свой сайт по тем же правилам можно в бесплатном инструменте — он ничего не просит и показывает результат на фоне 279 сайтов студий.