Что такое llms.txt и кто его придумал?
Стандарт llms.txt предложил в сентябре 2024 года Джереми Ховард (Jeremy Howard) — сооснователь Answer.AI и fast.ai, один из самых цитируемых людей в прикладном машинном обучении. Идея простая: у языковых моделей ограниченное контекстное окно, а типичная веб-страница — это мегабайты HTML, скриптов и навигации, из которых полезного текста — доли процента. Вместо того чтобы заставлять ИИ продираться сквозь вёрстку, сайт может сам отдать компактный конспект в формате, который модели понимают лучше всего, — в Markdown.
Важно понимать статус: llms.txt — добровольная конвенция, а не официальный стандарт. Ни один разработчик нейросетей формально не обязался его учитывать. Но поддержка растёт: файл опубликовали Anthropic, Perplexity, Cloudflare, Stripe, Zapier и тысячи других компаний, а генераторы llms.txt появились в популярных CMS и фреймворках документации. По сути, это повторение истории robots.txt: тот тоже начинался как неформальная договорённость 1994 года — и стал общепринятой нормой.
Чем llms.txt отличается от robots.txt и sitemap.xml?
Эти три файла часто путают, хотя задачи у них разные и они не заменяют друг друга, а дополняют.
| Файл | Назначение | Формат | Аудитория |
|---|---|---|---|
robots.txt |
Запреты и разрешения: куда роботам можно, куда нельзя | Собственный текстовый синтаксис (User-agent, Disallow) | Все краулеры: поисковые и ИИ |
sitemap.xml |
Полный список URL для индексации, без пояснений | XML | Поисковые роботы (Яндекс, Google) |
llms.txt |
Смысловая карта: кто вы, что важно, где искать ответы | Markdown | Большие языковые модели и ИИ-агенты |
Коротко: robots.txt отвечает на вопрос «куда можно?», sitemap.xml — «что существует?», а llms.txt — «что важно и почему?». Если вы всерьёз занимаетесь оптимизацией под ответы нейросетей (AEO), нужны все три.
Как создать llms.txt: пошагово
Структура файла зафиксирована в спецификации и намеренно проста. Порядок такой:
- H1 с названием проекта — единственный обязательный элемент. Одна строка, начинается с
#. - Blockquote-описание — абзац после
>: суть вашего бизнеса в одном-двух предложениях. Именно его модель прочитает первым. - Ключевые факты — короткий список того, что ИИ должен знать о вас: специализация, цены, география, отличия.
- Секции H2 со списками ссылок — каждая ссылка в формате
[название](URL): аннотация. Аннотация обязательна: она объясняет модели, что на странице, без перехода по ссылке. - Секция Optional (по желанию) — второстепенные ссылки, которые модель может пропустить при нехватке контекста.
Вот полный рабочий пример — наш собственный файл llms.txt, который можно взять за шаблон и адаптировать под свой сайт:
# AEO-Agency
> Российское агентство Answer Engine Optimization (AEO): делаем сайты
> видимыми для нейросетей — ChatGPT, Алиса AI, GigaChat, Perplexity,
> Gemini. Аудит 8 999 ₽, внедрение под ключ, мониторинг видимости.
Ключевые факты:
- AEO-аудит по 8 категориям (доступность для ИИ-краулеров, llms.txt,
Schema.org, структура контента, FAQ, E-E-A-T, сущность бренда,
видимость в LLM) с оценкой 0–100.
- Специализация на российских нейросетях: Алиса AI, GigaChat,
DeepSeek — плюс ChatGPT и Perplexity.
- Бесплатная проверка, история замеров и экспертный аудит доступны
внутри одного продукта AEO-Agency.
## Страницы
- [Главная и услуги](https://aeo-agency.ru/): аудит, замер видимости,
внедрение AEO, сопровождение — с ценами и сроками.
- [Частые вопросы](https://aeo-agency.ru/#faq): что такое AEO,
сколько стоит, когда будет результат.
## Контакты
- Email: hello@aeo-agency.ru
Сохраните файл в кодировке UTF-8, положите в корень сайта (чтобы он открывался по адресу вашдомен.ру/llms.txt) и убедитесь, что сервер отдаёт его со статусом 200. На всё уходит около часа — большая часть времени тратится не на технику, а на формулировки.
Частые ошибки
- HTML вместо Markdown. Некоторые CMS оборачивают любой URL в шаблон страницы. llms.txt должен отдаваться как чистый текст — проверьте ответ сервера, а не только вид в браузере.
- Свалка всех ссылок подряд. Файл на 500 URL без структуры — это второй sitemap, а не карта смыслов. Отберите 10–30 действительно важных страниц.
- Ссылки без аннотаций. Голый список URL не даёт модели ничего: она не знает, что за ссылкой. Одно поясняющее предложение на ссылку — обязательный минимум.
- Забыли обновлять. Изменились цены, услуги или адреса страниц — llms.txt должен измениться в тот же релиз. Устаревший файл хуже отсутствующего: модель уверенно перескажет неправду.
- Противоречие с robots.txt. Если вы блокируете ИИ-краулеров в robots.txt, они не доберутся и до llms.txt. Проверьте, что GPTBot, ClaudeBot и PerplexityBot не запрещены.
Работает ли это? Честный ответ
Скажем прямо: прямых гарантий нет. Стандарт молодой, публичных подтверждений «мы учитываем llms.txt в ранжировании ответов» никто из разработчиков нейросетей не давал, а исследования влияния пока единичны и противоречивы.
Почему мы всё равно рекомендуем внедрять? Арифметика проста. Стоимость — примерно час работы, риски — нулевые (файл никак не мешает обычному SEO). При этом краулеры Anthropic и Perplexity уже сегодня регулярно запрашивают именно такие файлы — это видно в серверных логах, — а заметная часть площадок (документация Anthropic, Cloudflare, Stripe и других) отдаёт даже расширенный llms-full.txt с полным содержимым страниц. Когда стандарт станет общепринятым — а история robots.txt намекает, что вероятность высокая, — ваш сайт уже будет готов.
Один нюанс: llms.txt — только один из кирпичей. Без структурированных данных он работает вполсилы, поэтому следующим шагом стоит разобраться с разметкой Schema.org для ИИ — а если хочется сразу закрыть весь технический слой, посмотрите нашу услугу внедрения AEO под ключ.
Частые вопросы
Нужен ли llms.txt, если на сайте уже есть sitemap.xml?
Да, это разные инструменты. Sitemap.xml — механический список всех URL для поисковых роботов, без пояснений. llms.txt — короткая аннотированная выжимка для языковых моделей: кто вы, какие страницы главные и что на них искать. Sitemap отвечает на вопрос «что обойти», llms.txt — «что важно и почему».
Куда положить llms.txt и как проверить, что он работает?
Файл кладут в корень сайта, чтобы он открывался по адресу вашдомен/llms.txt — как robots.txt. Проверка простая: откройте URL в браузере и убедитесь, что сервер отдаёт файл со статусом 200 и типом text/plain или text/markdown, без редиректов и HTML-обёртки. Затем проверьте в логах сервера, заходят ли на него ИИ-краулеры: ClaudeBot, PerplexityBot, GPTBot.
Что такое llms-full.txt и нужен ли он обычному сайту?
llms-full.txt — расширенная версия: не карта со ссылками, а полное содержимое ключевых страниц в одном Markdown-файле, чтобы модель получила весь контент за один запрос. Его публикуют в основном документационные площадки и SaaS-сервисы. Обычному бизнес-сайту достаточно короткого llms.txt; llms-full.txt имеет смысл, если у вас объёмная база знаний или документация.