llms.txt и robots.txt для ИИ-ботов: как пригласить нейросети к себе на сайт
Пока одни спорят, вредят ли ИИ-боты сайтам, другие тихо разрешают им всё — и попадают в ответы ассистентов, где конкурентов просто нет. Управление доступом нейросетей к сайту сводится к двум файлам в корне: robots.txt и llms.txt. Вокруг второго много шума и завышенных ожиданий, поэтому разберём честно, что каждый из них реально делает.
Кто вообще ходит по сайту
ИИ-краулеры делятся на два принципиально разных типа, и путать их — главная ошибка при настройке.
| Тип бота | Зачем приходит | Примеры |
|---|---|---|
| Обучающие | Собирают контент в обучающий корпус будущих моделей | GPTBot, ClaudeBot, CCBot, Google-Extended |
| Retrieval / поисковые | Читают страницу в момент ответа пользователю, дают ссылку | OAI-SearchBot, PerplexityBot, ChatGPT-User |
Разница решающая. Retrieval-боты — это ваш канал попадания в живые ответы ассистента прямо сейчас: закроете их — вас перестанут цитировать. Обучающие боты кормят будущие модели; пускать их или нет — вопрос вашей стратегии и отношения к тому, что контент попадёт в тренировку.
robots.txt: рабочая лошадка
robots.txt — старый и понятный файл, его понимают все краулеры, включая ИИ-ботов. В нём вы для каждого бота (директива для конкретного user-agent) разрешаете или запрещаете обход разделов. Логика простая:
- Если цель — попасть в ответы нейросетей, retrieval-боты пускайте однозначно. Это тот трафик, ради которого всё затевается.
- Обучающие боты — на ваше усмотрение. Медиа, живущее на трафике, может их закрыть; продукт, которому нужна узнаваемость в будущих моделях, — открыть.
- Не закрывайте ИИ-ботов «на всякий случай» скопом. Частая ошибка — запретить заодно и retrieval-ботов, а потом удивляться, почему ассистенты не ссылаются.
Важно: robots.txt — это вежливая просьба, а не замок. Добросовестные боты крупных компаний её соблюдают, но полагаться на неё как на защиту нельзя.
llms.txt: что это и чего от него не ждать
llms.txt — молодой файл-указатель для языковых моделей. В нём коротко, человеческим языком, описывают, о чём сайт, и дают ссылки на канонические, самые важные страницы. Идея красивая: вместо того чтобы модель продиралась через меню и баннеры, вы сами показываете ей суть и первоисточники.
Честно про хайп: аудиты показывают, что фоновые обучающие краулеры почти не запрашивают llms.txt. Как «магнит для цитирования» прямо сейчас он переоценён.
Значит ли это, что файл бесполезен? Нет. Он работает не в том слое, где его меряют критики: llms.txt полезен агентам реального времени и инструментам, которые обращаются к сайту здесь и сейчас, а также как аккуратная карта первоисточников. Стоит он дёшево (текстовый файл), вреда не несёт, а потенциальную пользу даёт — поэтому его разумно завести, но без завышенных ожиданий. Главную работу всё равно делают SEO и машиночитаемая разметка.
Порядок настройки
- Заведите robots.txt и явно перечислите retrieval-ботов с разрешением обхода.
- Решите осознанно, что делать с обучающими ботами, — и пропишите это, а не оставляйте по умолчанию.
- Добавьте llms.txt с кратким описанием сайта и ссылками на ключевые страницы — методологию, каталог, первоисточники.
- Убедитесь, что важные факты отдаются сервером и размечены Schema.org, — без этого ни один файл не поможет.
Файлы в корне — это приглашение, а не гарантия. Пустят боты или нет — половина дела; вторая половина в том, найдут ли они на странице готовый машиночитаемый факт. Как размечать данные, чтобы их было легко извлечь, разобрано в статье про Schema.org для товаров и рейтингов, а зачем всё это в целом — в разборе что такое GEO. Мы в ProofRank явно приглашаем ИИ-краулеров в robots.txt и отдаём llms.txt с картой рейтингов — потому что цель продукта в том, чтобы нас цитировали.
ProofRank — независимый рейтинг продуктов с открытой методологией, который цитируют ИИ-ассистенты. Посмотрите, как считается ProofScore, и добавьте интересные рейтинги в избранное.
Смотреть рейтинги → Методология