← Ghiduri

GPTBot, PerplexityBot, ClaudeBot: pe cine să lași în robots.txt

De ce robots.txt este primul filtru pentru boții AI

În două săptămâni din iulie, un panel de trei magazine din indexul nostru de trafic AI a înregistrat circa 1.005.146 de accesări ale boților AI — doar vendorul de top a adus 606.017, aproximativ 34.000 pe zi. Nu mai este zgomot de fundal: modelele de limbaj citesc activ cataloagele ca să răspundă cumpărătorilor. robots.txt, în rădăcina site-ului, este primul loc unde decizi pe care dintre acești boți îi lași să intre.

O precizare de la început: robots.txt este o înțelegere, nu un lacăt. Boții politicoși îl citesc și îl respectă, dar fișierul în sine nu blochează nimic fizic. Revenim la asta la final.

Cele trei roluri ale boților AI

Nu toți boții AI sunt la fel. Fiecare vendor rulează mai mulți, cu sarcini diferite:

Pentru un magazin, a doua și a treia grupă contează cel mai mult — ele te duc în răspunsul pe care cumpărătorul chiar îl vede. Antrenarea ține de gust: unii o permit pentru prezența brandului, alții o închid ca să nu dea conținutul gratis.

Referință User-Agent

VendorUser-AgentCe face
OpenAIGPTBotantrenarea modelelor
OpenAIOAI-SearchBotrăspunsuri în căutarea ChatGPT
OpenAIChatGPT-Userun om a deschis linkul prin ChatGPT
AnthropicClaudeBot, anthropic-aiantrenarea modelelor
AnthropicClaude-Userun om a deschis linkul prin Claude
PerplexityPerplexityBotindex pentru răspunsuri
PerplexityPerplexity-Userun om a deschis linkul prin Perplexity
GoogleGoogle-Extendedantrenare Gemini / AI
AppleApplebot-Extendedantrenarea AI Apple
ByteDanceBytespidercolectare de date
Common CrawlCCBotset de date deschis pentru antrenare

Antrenare vs răspunsuri: capcana Google-Extended

Cea mai frecventă greșeală este să crezi că „blochez AI" și „rămân în căutare" sunt același lucru. Nu sunt.

Google-Extended nu este un crawler separat. Este un token-comutator: îi spune Google dacă poate folosi conținutul tău ca să antreneze Gemini. Googlebot-ul obișnuit continuă să te indexeze, iar pozițiile în căutare nu sunt afectate. Poți renunța la antrenarea AI a Google fără să pierzi un strop de SEO.

Aceeași logică la OpenAI. Blochezi GPTBot și conținutul nu mai hrănește antrenarea. Dar dacă închizi și OAI-SearchBot, ieși din răspunsurile căutării ChatGPT. Dacă vrei „nu mă antrena, dar păstrează-mă în răspunsuri", blochează GPTBot și lasă OAI-SearchBot deschis.

Exemple de directive robots.txt

Strategia deschisă — pentru un magazin care vrea să vândă prin AI. Îi lăsăm pe toți:

# Lăsăm toți boții AI
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

# Motoarele clasice — mereu deschise
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

Sitemap: https://magazinul-tau.ro/sitemap.xml

Strategia „nu antrena, dar rămâi în răspunsuri":

# nu dăm conținut la antrenare
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

# dar rămânem în răspunsurile live ChatGPT și Perplexity
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# scoatem explicit scraperul „lacom"
User-agent: Bytespider
Disallow: /

Googlebot și Bingbot nu se ating — niciodată

Tentația de a scrie User-agent: * și Disallow: / ca să „închizi tot ce e AI" se termină dezastruos: sub * intră motoarele clasice Googlebot și Bingbot, iar site-ul iese din căutarea obișnuită. Traficul din Google încă îți aduce grosul comenzilor — să-l omori ca să lupți cu AI este autodistrugere.

Regula e simplă: Googlebot și Bingbot rămân deschise, mereu. Firewall-ul Botmetria are această siguranță integrată — nu pot fi blocate nici din greșeală.

De ce robots.txt singur nu ajunge

robots.txt se bazează pe cuvântul de onoare, ceea ce lasă două găuri:

  1. Oricine poate falsifica șirul User-Agent. Un scraper trimite antetul GPTBot și Allow-ul tău pentru GPTBot îl lasă să treacă. Iar Bytespider și câțiva boți agresivi au ignorat istoric robots.txt cu totul.
  2. O blocare în fișier nu e o blocare reală. Un bot politicos citește Disallow și pleacă. Unul nepoliticos, nu.

De aceea Botmetria nu crede User-Agent-ul pe cuvânt. Fiecare bot AI este verificat față de intervalele IP publicate ale vendorului — un GPTBot real vine de pe IP-urile OpenAI, iar un fals este prins și tăiat de firewall. Boții care execută JavaScript sunt tratați ca oameni, nu ca crawlere, așa că vizitele reale nu se amestecă cu colectoarele de date.

Începe cu puțin — vezi cine îți umblă deja pe domeniu. Un audit Botmetria gratuit îți verifică robots.txt și arată căror boți le ești deschis; apoi compară-te cu piața în ratingul magazinelor MD/RO.

Întrebări frecvente

Dacă blochez GPTBot, dispar din căutarea Google?

Nu. GPTBot este crawlerul OpenAI și nu are legătură cu Google. Chiar și blocarea Google-Extended îți lasă pozițiile intacte — Googlebot obișnuit continuă să te indexeze. SEO suferă doar dacă închizi din greșeală Googlebot sau Bingbot, ceea ce nu trebuie făcut niciodată.

Dacă blochez toți boții AI, mai apar în răspunsurile ChatGPT?

Nu. Ca să apari în răspunsurile căutării ChatGPT ține OAI-SearchBot deschis, iar pentru Perplexity ține PerplexityBot deschis. Blochează doar crawlerele de antrenare (GPTBot, Google-Extended), lăsând boții de răspuns permiși.

Chiar blochează robots.txt boții AI?

Doar pe cei politicoși. Fișierul este o înțelegere: șirul User-Agent se falsifică ușor, iar unii boți (Bytespider, de exemplu) ignoră robots.txt. Blocarea sigură se face la nivel de firewall, verificând intervalele IP ale vendorului — exact ce face Botmetria.

Ghiduri conexe

Verifică magazinul gratuit

Un audit de 60 de secunde arată cât de pregătit e magazinul pentru agenții AI — și ce să repari mai întâi.

Pornește auditul gratuit