Le réflexe qui coûte cher : bloquer GPTBot sans comprendre ce qu'il fait
La plupart des propriétaires de sites qui ajoutent une ligne "Disallow" à leur robots.txt pour "bloquer l'IA" finissent par bloquer le mauvais bot — ou par tout bloquer, y compris celui qui aurait pu citer leur contenu dans une réponse ChatGPT ou Perplexity. La confusion vient d'un point simple : "crawler IA" n'est pas une catégorie unique. Depuis 2025, OpenAI, Anthropic et Perplexity font tourner des bots distincts pour deux usages radicalement différents — l'entraînement de leurs modèles, et l'indexation en temps réel pour répondre aux questions des utilisateurs. Bloquer le premier n'a strictement aucun effet sur le second, et inversement.
Cet article démêle la distinction, te donne un robots.txt type qui bloque l'entraînement sans sacrifier ta visibilité GEO, et va un cran plus loin avec le TDM Reservation Protocol (TDMRep) — un mécanisme moins connu qui laisse une trace de ta décision, au-delà du simple robots.txt.
GPTBot n'est pas OAI-SearchBot : la distinction que la plupart des robots.txt ratent
OpenAI fait tourner trois bots séparés, chacun contrôlable indépendamment dans ton robots.txt :
GPTBot: crawl en masse, sans urgence, dédié à l'entraînement des futurs modèles. Le bloquer ne change rien à ta présence dans les réponses ChatGPT actuelles.OAI-SearchBot: indexe en continu pour alimenter les citations dans ChatGPT Search. C'est lui qui compte si tu veux apparaître comme source.ChatGPT-User: se déclenche quand un utilisateur colle ton URL directement dans ChatGPT, ou quand un agent navigue en session live sur ton site.
Anthropic suit exactement la même logique à trois bots : ClaudeBot (entraînement), Claude-SearchBot (indexation pour les citations Claude), Claude-User (requêtes utilisateur en direct). Perplexity fonctionne avec deux bots : PerplexityBot pour son pool de sources, Perplexity-User pour la récupération en temps réel. Google, de son côté, utilise Google-Extended — un jeton d'opt-out qui ne crawle rien lui-même, il modifie seulement l'usage que Google fait des pages déjà crawlées par Googlebot pour l'entraînement de Gemini.
Un dernier cas à connaître : Bytespider, le bot de ByteDance, a la réputation de ne pas toujours respecter le robots.txt. Le bloquer dans le fichier ne suffit pas toujours — un blocage au niveau du WAF ou du CDN est parfois nécessaire si tu veux vraiment l'exclure.
| Bot | Éditeur | Rôle | Entraînement | Citation/recherche |
|---|---|---|---|---|
GPTBot | OpenAI | Entraînement | Bloquer si tu veux protéger ton contenu | — |
OAI-SearchBot | OpenAI | Citations ChatGPT Search | — | Autoriser pour être cité |
ChatGPT-User | OpenAI | Session utilisateur live | — | Autoriser pour être consulté |
ClaudeBot | Anthropic | Entraînement | Bloquer si tu veux protéger ton contenu | — |
Claude-SearchBot | Anthropic | Citations Claude | — | Autoriser pour être cité |
Claude-User | Anthropic | Session utilisateur live | — | Autoriser pour être consulté |
PerplexityBot | Perplexity | Pool de sources | — | Autoriser pour être cité |
Perplexity-User | Perplexity | Récupération temps réel | — | Autoriser pour être consulté |
Google-Extended | Opt-out entraînement Gemini | Bloquer (jeton, pas un crawl) | — | |
Bytespider | ByteDance | Mal identifié, ignore parfois le robots.txt | Bloquer + WAF | — |
Combien ça coûte de tout bloquer par réflexe
Un chiffre à garder en tête avant de tout couper : selon une analyse de l'activité des crawlers IA publiée début 2026, le trafic des bots d'entraînement représente désormais environ 82 % de l'activité des crawlers IA sur le web, contre 72 % un an plus tôt — et le trafic référé par les IA vers les sites (les citations qui génèrent un vrai clic humain) a bondi de 975 % entre janvier 2025 et janvier 2026. La part qui compte pour ta visibilité GEO progresse vite, mais elle reste minoritaire dans le flux brut de requêtes que ton serveur encaisse — d'où la tentation de tout bloquer pour "économiser de la bande passante", au prix de rater la partie qui grossit le plus vite.
Même écart côté ratio crawl/référencement : une analyse distincte situe le ratio crawl-to-referral d'Anthropic autour de 70 900 requêtes pour 1 clic humain généré, contre environ 5 pour 1 chez Googlebot. Ce chiffre explique pourquoi certains administrateurs bloquent ClaudeBot par réflexe — sauf qu'en bloquant aussi Claude-SearchBot par erreur (les deux user-agents contiennent "Claude", et une règle mal écrite les traite souvent comme un seul bloc), ils se privent des citations, pas seulement du crawl d'entraînement qui pèse sur le serveur.
Concrètement : si tu gères un site e-commerce avec 50 000 pages produit et que ton robots.txt a une seule ligne User-agent: * suivie de Disallow: /produits/ pour "protéger le catalogue de l'IA", tu bloques indistinctement GPTBot ET OAI-SearchBot ET Claude-SearchBot — ce qui revient à te retirer volontairement de toute réponse ChatGPT ou Claude sur tes produits, alors que seul le premier posait un enjeu de propriété intellectuelle.
Un robots.txt qui bloque l'entraînement sans sacrifier tes citations
Voici un point de départ réaliste, à adapter selon ta tolérance au risque :
# Bloque l'entraînement des modèles
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Autorise les bots de citation et de recherche
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Perplexity-User
Allow: /
Note importante : cette configuration protège l'entraînement, pas le crawl "utilisateur live" (ChatGPT-User, Claude-User, Perplexity-User), qui se déclenche quand une vraie personne interagit avec ton site via ces IA — les bloquer revient à empêcher ces utilisateurs de consulter ton contenu depuis leur assistant, une expérience différente du crawl automatisé classique.
Aller plus loin que le robots.txt : le TDM Reservation Protocol
Le robots.txt reste, depuis 1994, un accord de courtoisie sans valeur contraignante : rien n'empêche techniquement un crawler de l'ignorer. Le TDM Reservation Protocol (TDMRep), rapport final du groupe de travail communautaire du W3C, propose un mécanisme différent : une déclaration de droits machine-lisible, explicitement mentionnée dans le droit européen (article 4 de la directive UE 2019/790 sur le droit d'auteur dans le marché unique numérique, repris ensuite par le règlement sur l'IA 2024/1689). Le protocole ne remplace pas le robots.txt, il ajoute une couche de preuve.
TDMRep se déclare de trois façons possibles : un fichier JSON à /.well-known/tdmrep.json, un en-tête HTTP envoyé par ton serveur, ou une balise meta dans le <head> de tes pages. Exemple de fichier JSON :
{
"tdm": [{
"policy": "https://tonsite.fr/politique-tdm",
"tdm-reservation": 1
}]
}
Mettre tdm-reservation à 1 réserve tes droits de fouille de textes et de données ; 0 les laisse ouverts. Point souvent mal compris : TDMRep n'a aucun effet sur ton classement Google ni sur ta citation par les moteurs IA — le protocole documente uniquement une position sur l'entraînement, il ne pilote ni crawl, ni indexation, ni ranking. Tu peux donc réserver tes droits d'entraînement via TDMRep tout en gardant OAI-SearchBot et Claude-SearchBot grand ouverts pour continuer à être cité — les deux sujets sont indépendants. Ceci reste un point technique, pas un conseil juridique : si la question a un enjeu réel pour ton activité (contenu premium, données propriétaires), le mieux est d'en parler avec quelqu'un de qualifié sur le sujet, pas avec un article de blog.
Quel choix faire selon ton profil
- SaaS en content marketing, objectif = visibilité et leads : autorise large. Ta priorité est d'être cité, pas de protéger un contenu qui n'a de valeur que diffusé. Bloquer les bots de citation par prudence excessive te coûte plus cher que ce que tu penses protéger.
- E-commerce avec un catalogue et des prix propriétaires : autorise les bots de citation sur les pages de contenu (guides, comparatifs), réfléchis au cas par cas pour les fiches produit si la donnée de prix a une vraie valeur concurrentielle. Si tu veux visualiser à quoi ressemble un audit complet avant de te lancer, regarde un exemple de rapport.
- Média ou éditeur avec du contenu premium/payant : c'est le profil pour lequel TDMRep prend le plus de sens en complément du
robots.txt— la déclaration machine-lisible crée une trace en cas de litige, ce que lerobots.txtseul ne fait pas.
Vérifier que ta configuration fonctionne réellement
Un robots.txt bien écrit ne garantit rien si le bot ne le respecte pas, ou si un proxy/CDN réécrit tes règles sans que tu le voies. La seule vérification fiable passe par les logs serveur : chercher les user-agents réels dans les requêtes brutes, confirmer que GPTBot n'apparaît plus après blocage et que OAI-SearchBot continue bien de passer. Notre guide d'analyse des logs serveur pour les bots IA détaille la méthode, requête par requête. Pour la syntaxe complète du robots.txt, y compris la gestion de Googlebot en parallèle des bots IA, notre guide robots.txt 2026 couvre l'ensemble.
FAQ
Bloquer GPTBot dans mon robots.txt m'exclut-il de ChatGPT ?
Non. GPTBot sert uniquement à l'entraînement des futurs modèles. Ta présence dans les réponses ChatGPT Search dépend d'OAI-SearchBot, un bot totalement distinct que tu peux garder ouvert même en bloquant GPTBot.
Le TDM Reservation Protocol remplace-t-il le robots.txt ?
Non, il s'ajoute. Le robots.txt bloque l'accès technique ; TDMRep déclare une position sur les droits d'usage, avec une base légale explicite en droit européen, même si un crawler accède quand même à la page.
Comment savoir si mon robots.txt est vraiment respecté ?
En analysant tes logs serveur pour repérer les vrais user-agents des requêtes entrantes, pas seulement en te fiant au fichier lui-même — certains bots, comme Bytespider, ont la réputation de ne pas toujours le respecter.
À retenir
Un crawler IA n'est pas une catégorie unique : OpenAI, Anthropic et Perplexity séparent explicitement leurs bots d'entraînement (GPTBot, ClaudeBot) de leurs bots de citation (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Bloquer les premiers sans toucher aux seconds protège ton contenu de l'entraînement sans sacrifier ta visibilité GEO. Le TDM Reservation Protocol va plus loin en ajoutant une déclaration de droits machine-lisible, complémentaire du robots.txt.
Envie de vérifier où ta configuration actuelle laisse filer de la visibilité GEO sans que tu le saches ? Obtiens ton score /100 avec un audit SeAudit.
