GPTBot, PerplexityBot, ClaudeBot: кого пускать в robots.txt
Обновлено 2026-08-03
Почему robots.txt — первый рубеж для ИИ-ботов
За две недели июля панель из трёх магазинов в индексе AI-трафика получила около 1 005 146 обращений ИИ-ботов — один только топ-вендор дал 606 017 хитов, примерно 34 000 в день. Это уже не фоновый шум: языковые модели активно читают каталоги, чтобы отвечать покупателям. robots.txt в корне сайта — первое место, где вы решаете, кого из этих ботов пустить, а кого нет.
Сразу оговорка: robots.txt — это договорённость, а не замок. Вежливые боты его читают и слушаются, но сам файл ничего физически не блокирует. К этому вернёмся в конце.
Три роли ИИ-ботов
Не все ИИ-боты одинаковы. У каждого вендора их несколько, и задачи у них разные:
- Краулеры обучения собирают контент, чтобы обучать будущие модели:
GPTBot(OpenAI),ClaudeBot(Anthropic),Google-Extended(Gemini),Applebot-Extended(Apple),CCBot(Common Crawl),Bytespider(ByteDance). - Боты для ответов приходят в момент запроса, чтобы собрать свежий ответ пользователю прямо сейчас:
OAI-SearchBot(поиск ChatGPT),PerplexityBot,Claude-SearchBot. - Агенты живого человека срабатывают, когда реальный покупатель попросил ассистента открыть вашу ссылку:
ChatGPT-User,Perplexity-User,Claude-User.
Для магазина ценнее всего вторая и третья группы: именно они приводят вас в ответ, который видит покупатель. Обучение — вопрос вкуса: кто-то пускает ради присутствия бренда, кто-то закрывает, чтобы не отдавать контент даром.
Справочник User-Agent'ов
| Вендор | User-Agent | Что делает |
|---|---|---|
| OpenAI | GPTBot | обучение моделей |
| OpenAI | OAI-SearchBot | ответы в поиске ChatGPT |
| OpenAI | ChatGPT-User | человек открыл ссылку через ChatGPT |
| Anthropic | ClaudeBot, anthropic-ai | обучение моделей |
| Anthropic | Claude-User | человек открыл ссылку через Claude |
| Perplexity | PerplexityBot | индекс для ответов |
| Perplexity | Perplexity-User | человек открыл ссылку через Perplexity |
Google-Extended | обучение Gemini / ИИ | |
| Apple | Applebot-Extended | обучение ИИ Apple |
| ByteDance | Bytespider | сбор данных |
| Common Crawl | CCBot | открытый датасет для обучения |
Обучение против ответов: тонкость с Google-Extended
Самая частая ошибка — считать, что «блокирую ИИ» и «остаюсь в поиске» — одно и то же. Это не так.
Google-Extended — это не отдельный краулер, а токен-переключатель: он говорит Google, можно ли использовать ваш контент для обучения Gemini. Обычный Googlebot при этом продолжает индексировать сайт, и на позиции в поиске это не влияет. То есть вы можете отказаться от ИИ-обучения Google, не теряя ни капли SEO.
Та же логика с OpenAI. Заблокировали GPTBot — контент не идёт на обучение. Но если при этом закрыть и OAI-SearchBot, вы выпадете из ответов ChatGPT-поиска. Хотите «не учить, но остаться в ответах» — блокируйте GPTBot, но оставляйте OAI-SearchBot открытым.
Примеры директив robots.txt
Открытая стратегия — для магазина, который хочет продавать через ИИ. Пускаем всех:
# Пускаем всех ИИ-ботов
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /
# Классические поисковики — открыты всегда
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
Sitemap: https://ваш-магазин.md/sitemap.xml
Стратегия «не учить, но остаться в ответах»:
# не отдаём контент на обучение
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# но остаёмся в живых ответах ChatGPT и Perplexity
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# явно выгоняем «жадный» скрапер
User-agent: Bytespider
Disallow: /
Googlebot и Bingbot трогать нельзя — никогда
Соблазн написать User-agent: * и Disallow: /, чтобы «закрыться от всех ИИ», заканчивается катастрофой: под * попадают классические поисковики Googlebot и Bingbot, и сайт вылетает из обычного поиска. Трафик из Google по-прежнему приносит основную массу заказов — это самоубийство ради борьбы с ИИ.
Правило простое: Googlebot и Bingbot всегда открыты. В файрволе Botmetria этот предохранитель встроен — их нельзя заблокировать даже случайно.
Почему одного robots.txt мало
robots.txt держится на честном слове, и отсюда две дыры:
- Строку User-Agent может подделать кто угодно. Скрапер отправляет заголовок
GPTBot— и вашAllowдля GPTBot пускает его. АBytespiderи часть агрессивных ботов исторически robots.txt просто игнорируют. - Блокировка в файле ≠ реальная блокировка. Вежливый бот прочитает
Disallowи уйдёт. Невежливый — нет.
Поэтому Botmetria не верит User-Agent на слово. Каждый ИИ-бот сверяется с опубликованными IP-диапазонами вендора — настоящий GPTBot приходит с IP OpenAI, подделка ловится и режется файрволом. А боты, которые исполняют JavaScript, считаются людьми, а не краулерами, — так реальные визиты не путаются со сборщиками данных.
Начните с малого — посмотрите, кто уже ходит по вашему домену. Бесплатный аудит Botmetria проверит robots.txt и покажет, каким ботам вы открыты; заодно загляните в рейтинг магазинов MD/RO, чтобы сравнить себя с рынком.
Частые вопросы
Заблокирую GPTBot — выпаду ли я из поиска Google?
Нет. GPTBot — краулер OpenAI, к Google он отношения не имеет. И даже блокировка Google-Extended не влияет на позиции: обычный Googlebot продолжает индексировать сайт. SEO страдает, только если случайно закрыть сам Googlebot или Bingbot — этого делать нельзя.
Если закрыть всех ИИ-ботов, попаду ли я в ответы ChatGPT?
Нет. Чтобы попасть в ответы ChatGPT-поиска, оставьте открытым OAI-SearchBot, а для Perplexity — PerplexityBot. Блокировать имеет смысл только обучающие краулеры (GPTBot, Google-Extended), сохранив «ответные» боты.
robots.txt реально блокирует ИИ-ботов?
Только вежливых. Файл — это договорённость: строку User-Agent легко подделать, а часть ботов (например, Bytespider) robots.txt игнорируют. Надёжная блокировка — на уровне файрвола с проверкой IP-диапазонов вендора, как делает Botmetria.
Связанные гайды
Проверьте магазин бесплатно
Аудит за 60 секунд покажет, насколько магазин готов к ИИ-агентам — и что чинить первым.