← Гайды

GPTBot, PerplexityBot, ClaudeBot: кого пускать в robots.txt

Почему robots.txt — первый рубеж для ИИ-ботов

За две недели июля панель из трёх магазинов в индексе AI-трафика получила около 1 005 146 обращений ИИ-ботов — один только топ-вендор дал 606 017 хитов, примерно 34 000 в день. Это уже не фоновый шум: языковые модели активно читают каталоги, чтобы отвечать покупателям. robots.txt в корне сайта — первое место, где вы решаете, кого из этих ботов пустить, а кого нет.

Сразу оговорка: robots.txt — это договорённость, а не замок. Вежливые боты его читают и слушаются, но сам файл ничего физически не блокирует. К этому вернёмся в конце.

Три роли ИИ-ботов

Не все ИИ-боты одинаковы. У каждого вендора их несколько, и задачи у них разные:

Для магазина ценнее всего вторая и третья группы: именно они приводят вас в ответ, который видит покупатель. Обучение — вопрос вкуса: кто-то пускает ради присутствия бренда, кто-то закрывает, чтобы не отдавать контент даром.

Справочник User-Agent'ов

ВендорUser-AgentЧто делает
OpenAIGPTBotобучение моделей
OpenAIOAI-SearchBotответы в поиске ChatGPT
OpenAIChatGPT-Userчеловек открыл ссылку через ChatGPT
AnthropicClaudeBot, anthropic-aiобучение моделей
AnthropicClaude-Userчеловек открыл ссылку через Claude
PerplexityPerplexityBotиндекс для ответов
PerplexityPerplexity-Userчеловек открыл ссылку через Perplexity
GoogleGoogle-Extendedобучение Gemini / ИИ
AppleApplebot-Extendedобучение ИИ Apple
ByteDanceBytespiderсбор данных
Common CrawlCCBotоткрытый датасет для обучения

Обучение против ответов: тонкость с Google-Extended

Самая частая ошибка — считать, что «блокирую ИИ» и «остаюсь в поиске» — одно и то же. Это не так.

Google-Extended — это не отдельный краулер, а токен-переключатель: он говорит Google, можно ли использовать ваш контент для обучения Gemini. Обычный Googlebot при этом продолжает индексировать сайт, и на позиции в поиске это не влияет. То есть вы можете отказаться от ИИ-обучения Google, не теряя ни капли SEO.

Та же логика с OpenAI. Заблокировали GPTBot — контент не идёт на обучение. Но если при этом закрыть и OAI-SearchBot, вы выпадете из ответов ChatGPT-поиска. Хотите «не учить, но остаться в ответах» — блокируйте GPTBot, но оставляйте OAI-SearchBot открытым.

Примеры директив robots.txt

Открытая стратегия — для магазина, который хочет продавать через ИИ. Пускаем всех:

# Пускаем всех ИИ-ботов
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

# Классические поисковики — открыты всегда
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

Sitemap: https://ваш-магазин.md/sitemap.xml

Стратегия «не учить, но остаться в ответах»:

# не отдаём контент на обучение
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

# но остаёмся в живых ответах ChatGPT и Perplexity
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# явно выгоняем «жадный» скрапер
User-agent: Bytespider
Disallow: /

Googlebot и Bingbot трогать нельзя — никогда

Соблазн написать User-agent: * и Disallow: /, чтобы «закрыться от всех ИИ», заканчивается катастрофой: под * попадают классические поисковики Googlebot и Bingbot, и сайт вылетает из обычного поиска. Трафик из Google по-прежнему приносит основную массу заказов — это самоубийство ради борьбы с ИИ.

Правило простое: Googlebot и Bingbot всегда открыты. В файрволе Botmetria этот предохранитель встроен — их нельзя заблокировать даже случайно.

Почему одного robots.txt мало

robots.txt держится на честном слове, и отсюда две дыры:

  1. Строку User-Agent может подделать кто угодно. Скрапер отправляет заголовок GPTBot — и ваш Allow для GPTBot пускает его. А Bytespider и часть агрессивных ботов исторически robots.txt просто игнорируют.
  2. Блокировка в файле ≠ реальная блокировка. Вежливый бот прочитает Disallow и уйдёт. Невежливый — нет.

Поэтому Botmetria не верит User-Agent на слово. Каждый ИИ-бот сверяется с опубликованными IP-диапазонами вендора — настоящий GPTBot приходит с IP OpenAI, подделка ловится и режется файрволом. А боты, которые исполняют JavaScript, считаются людьми, а не краулерами, — так реальные визиты не путаются со сборщиками данных.

Начните с малого — посмотрите, кто уже ходит по вашему домену. Бесплатный аудит Botmetria проверит robots.txt и покажет, каким ботам вы открыты; заодно загляните в рейтинг магазинов MD/RO, чтобы сравнить себя с рынком.

Частые вопросы

Заблокирую GPTBot — выпаду ли я из поиска Google?

Нет. GPTBot — краулер OpenAI, к Google он отношения не имеет. И даже блокировка Google-Extended не влияет на позиции: обычный Googlebot продолжает индексировать сайт. SEO страдает, только если случайно закрыть сам Googlebot или Bingbot — этого делать нельзя.

Если закрыть всех ИИ-ботов, попаду ли я в ответы ChatGPT?

Нет. Чтобы попасть в ответы ChatGPT-поиска, оставьте открытым OAI-SearchBot, а для Perplexity — PerplexityBot. Блокировать имеет смысл только обучающие краулеры (GPTBot, Google-Extended), сохранив «ответные» боты.

robots.txt реально блокирует ИИ-ботов?

Только вежливых. Файл — это договорённость: строку User-Agent легко подделать, а часть ботов (например, Bytespider) robots.txt игнорируют. Надёжная блокировка — на уровне файрвола с проверкой IP-диапазонов вендора, как делает Botmetria.

Связанные гайды

Проверьте магазин бесплатно

Аудит за 60 секунд покажет, насколько магазин готов к ИИ-агентам — и что чинить первым.

Запустить бесплатный аудит