Le 15 septembre 2026, Cloudflare a basculé les réglages par défaut de contrôle du trafic IA pour tous les nouveaux domaines et pour l'ensemble de son tier gratuit. Plus de 20 % des domaines du web mondial passent par son réseau — si ton SaaS ou ton e-commerce en fait partie, un réglage a peut-être changé sous tes pieds sans notification claire. Ce n'est pas un blocage accidentel comme avec le Bot Fight Mode classique qui bloque tes crawlers IA sans que tu le saches : c'est une nouvelle couche de classification volontaire, pensée pour trancher entre citation IA et entraînement de modèle.
Search, Agent, Training : trois catégories, trois enjeux GEO différents
Cloudflare classe désormais tout le trafic robotique IA en trois familles distinctes, chacune avec sa propre logique de contrôle dans le tableau de bord :
- Search — le trafic qui indexe ton contenu pour répondre à des questions plus tard, avec l'attente d'un trafic de référence en retour. C'est la catégorie qui alimente directement tes citations dans Google AI Overviews, les réponses ChatGPT ou Perplexity.
OAI-SearchBotetPerplexityBoten font partie. - Agent — un comportement automatisé qui agit en temps réel pour le compte d'un utilisateur, "pour faire quelque chose tout de suite" :
ChatGPT-Userqui va chercher une page pendant qu'un utilisateur discute, ou un agent de navigation façon Perplexity Comet. C'est la couche qui rend ton site actionnable pour l'IA agentique. - Training — les crawlers qui absorbent ton contenu pour entraîner ou affiner des modèles, de façon permanente.
GPTBotetClaudeBoten sont les représentants les plus connus.
Ces trois familles ne se recoupent pas forcément avec "bon" ou "mauvais" bot au sens anti-spoofing : un GPTBot parfaitement authentique reste un bot Training, que tu aies ou non intérêt à le bloquer selon ta stratégie éditoriale.
Ce qui bascule par défaut depuis le 15 septembre 2026
Avant cette date, les nouveaux domaines Cloudflare démarraient avec les trois catégories globalement ouvertes. Depuis, le comportement par défaut change spécifiquement sur les pages qui affichent de la publicité :
| Catégorie | Défaut avant le 15/09 | Défaut après le 15/09 (pages avec pub) |
|---|---|---|
| Search | Autorisé | Autorisé |
| Agent | Autorisé | Bloqué |
| Training | Autorisé | Bloqué |
La justification donnée par Cloudflare : une publicité est un signal que le propriétaire du site attendait un visiteur humain sur cette page précise, pas un agent ou un crawler d'entraînement. Le changement s'applique automatiquement aux nouveaux domaines et à l'ensemble du tier gratuit ; les clients existants sur un plan payant pouvaient refuser ce nouveau défaut avant le 15 septembre via leurs réglages de sécurité — après quoi, l'ancien comportement reste actif tant qu'ils ne le modifient pas eux-mêmes.
Pour vérifier ta configuration : dans le tableau de bord Cloudflare, section Security, chaque catégorie (Search / Agent / Training) se règle indépendamment sur trois niveaux — autoriser, bloquer partout, ou bloquer uniquement sur les pages monétisées par pub. La détection "page avec pub" repose sur les signaux internes de Cloudflare (scripts publicitaires détectés, réseaux ad-tech connus) — pas sur une déclaration manuelle de ta part, ce qui veut dire que le réglage peut s'appliquer à des pages où tu n'as même pas conscience d'afficher de la pub via un plugin tiers ou un composant hérité. Si ton blog génère des revenus publicitaires et que tu comptes sur les citations ChatGPT ou Perplexity pour ta visibilité GEO, ce réglage mérite un contrôle manuel plutôt qu'une confiance aveugle au défaut.
Content Signals Policy : la couche déclarative qui complète le blocage
En parallèle du blocage effectif au niveau du WAF, Cloudflare pousse depuis septembre 2025 une extension de robots.txt appelée Content Signals Policy. La syntaxe tient en une ligne :
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Trois signaux, trois usages distincts : search (indexation classique), ai-input (récupération en temps réel pour du RAG ou du grounding — la mécanique derrière une citation IA), et ai-train (entraînement ou fine-tuning de modèle). La sémantique est simple : yes autorise l'usage correspondant, no l'interdit, et l'absence de signal ne l'autorise ni ne l'interdit explicitement. Cloudflare va jusqu'à présenter ces restrictions comme des réserves de droits au sens de l'article 4 de la directive européenne sur les bases de données — un ancrage juridique réel, mais qui ne vaut que si le crawler en face respecte la déclaration.
C'est là la limite structurelle : Content-Signal est déclaratif, pas un mécanisme d'application technique. Rien n'empêche un crawler de l'ignorer purement et simplement. Cloudflare le dit lui-même : les signaux fonctionnent mieux combinés à un vrai contrôle de bot (WAF, règles Agent/Training vues plus haut), pas à leur place.
Content Signals se distingue aussi de la RSL (Really Simple Licensing), qui ajoute un modèle de monétisation (pay-per-crawl, abonnement) derrière la déclaration plutôt qu'un simple allow/deny — utile si tu cherches à te faire payer plutôt qu'à seulement autoriser ou interdire.
Qui affiche vraiment la directive aujourd'hui : vérification en direct
Plutôt que de reprendre le communiqué de presse, direction les robots.txt publics. cloudflare.com et blog.cloudflare.com affichent tous les deux la même ligne : Content-Signal: ai-train=yes, search=yes, ai-input=yes — Cloudflare ouvre tout sur ses propres domaines marketing, cohérent avec une entreprise qui a intérêt à être citée et entraînée partout. stackoverflow.com, à l'inverse, affiche Content-signal: search=no, ai-train=no — une position nettement plus défensive, qui referme même le signal d'indexation classique, pas seulement l'IA.
Sur une quinzaine d'autres domaines majeurs vérifiés (NYTimes, Reuters, Wired, Forbes, BBC, CNN, Medium, GitHub, The Verge, The Economist, Ars Technica, Search Engine Journal), aucun n'affiche encore la directive. Plus d'un an après son lancement, l'adoption reste embryonnaire — signe que la plupart des équipes SEO n'ont tout simplement pas ce chantier sur leur liste, malgré un coût de mise en œuvre proche de zéro.
Ce que ça change pour ton audit GEO
Trois décisions à prendre séparément, pas une seule case à cocher :
- Search — laisse ouvert si tu veux exister dans Google AI Overviews, ChatGPT ou Perplexity. Le fermer équivaut à sortir volontairement de la course GEO.
- Agent — dépend de ton modèle économique. Un SaaS qui veut qu'un agent façon Comet ou ChatGPT Atlas remplisse un formulaire ou compare une offre pour un utilisateur a intérêt à laisser cette catégorie ouverte sur ses pages produit et pricing, tout en la bloquant sur les pages purement monétisées par pub où elle n'apporte rien.
- Training — la seule catégorie où bloquer ne coûte quasiment rien en visibilité GEO immédiate : ton contenu peut continuer à être cité sans être absorbé dans l'entraînement d'un futur modèle. C'est le réglage le plus consensuel à fermer si tu veux protéger ta propriété intellectuelle sans sacrifier tes citations.
Pour approfondir la logique globale derrière ces arbitrages, le guide complet du GEO détaille la mécanique de citation par les moteurs de réponse au-delà du seul cas Cloudflare.
Checklist en 5 points pour ton audit :
- Vérifie dans ton dashboard Cloudflare (Security > Bots ou AI Crawl Control) l'état actuel des trois catégories, page par page si tu gères des zones mixtes pub / produit.
- Si tu es un nouveau domaine ou sur le tier gratuit, confirme que le défaut du 15 septembre correspond bien à ton intention, pas juste à ce que Cloudflare a choisi pour toi.
- Ajoute la ligne
Content-Signaldans tonrobots.txten complément — ça ne coûte rien et ça documente ta position pour les crawlers qui la respectent. - Ne confonds pas ce réglage avec le blocage accidentel classique du Bot Fight Mode : ce sont deux mécanismes différents, à auditer séparément.
- Recroise ta liste de bots autorisés avec une vérification d'authenticité (DNS inverse ou listes d'IP officielles) — un faux
GPTBotqui usurpe l'identité ne respectera aucun de ces signaux de toute façon.
Exemple concret : un SaaS B2B avec un blog monétisé par un bandeau publicitaire display, mais pas ses pages /pricing ni /produit. Sur un domaine récent chez Cloudflare, les agents et crawlers d'entraînement sont désormais bloqués par défaut sur les articles du blog (là où la pub tourne), mais restent autorisés sur les pages produit — exactement l'arbitrage recommandé plus haut. Le propriétaire n'a rien eu à configurer pour ce résultat, mais il aurait tort de ne pas vérifier que c'est bien ce qui s'est passé sur son compte.
Lance un audit gratuit sur SeAudit pour vérifier où ton site se situe sur ces réglages, ou passe directement au rapport complet pour voir le niveau de détail attendu sur la partie technique.
À retenir
- Depuis le 15 septembre 2026, Cloudflare bloque par défaut les catégories Agent et Training sur les pages avec publicité, pour les nouveaux domaines et le tier gratuit — Search reste ouvert.
- La Content Signals Policy (
Content-Signal: search=, ai-input=, ai-train=) est une couche déclarative distincte, complémentaire au blocage WAF, pas un substitut. - L'adoption réelle de la directive reste rare plus d'un an après son lancement : sur une quinzaine de sites majeurs vérifiés, seuls deux l'affichent.
- Pour ton GEO, la décision la plus simple est de fermer Training (protège ta propriété intellectuelle sans coût de visibilité) et de garder Search ouvert (sans lui, aucune citation IA possible).
FAQ
Le blocage Cloudflare du 15 septembre 2026 s'applique-t-il à mon site existant ?
Seulement si tu es un nouveau domaine ajouté après cette date, ou si tu es sur le tier gratuit. Les clients existants sur un plan payant gardent leur ancien comportement tant qu'ils ne changent pas eux-mêmes le réglage.
Content Signals Policy et Bot Fight Mode, c'est la même chose ?
Non. Bot Fight Mode et les règles Agent/Training bloquent effectivement le trafic au niveau du WAF. Content Signals Policy est une ligne déclarative dans robots.txt qui exprime une préférence, sans capacité de blocage technique propre.
Faut-il bloquer tous les crawlers IA pour protéger mon contenu ?
Non, pas si tu veux exister dans les réponses IA. Bloquer Search te retire de la course aux citations. Bloquer Training seul protège ton contenu de l'entraînement sans affecter ta visibilité GEO.
Comment savoir si un crawler qui se présente comme GPTBot ou ClaudeBot est authentique ?
Par une vérification DNS inverse ou les listes d'IP officielles publiées par chaque fournisseur — la méthode complète est détaillée dans notre guide dédié à la vérification anti-spoofing des bots IA.
Vérifie en 2 minutes si tes réglages Cloudflare et ton robots.txt sont alignés avec ta stratégie GEO : lance ton audit gratuit, ou passe au rapport complet pour un diagnostic technique détaillé.
