SeAudit
Tous les articles
SEO technique·8 min·2026-06-19

robots.txt en 2026 : contrôler Googlebot, GPTBot et ClaudeBot

Les crawlers d'IA prolifèrent : GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, CCBot... Votre robots.txt de 2022 ne suffit plus. Ce guide vous montre comment reprendre le contrôle de qui crawle votre site, avec la syntaxe exacte pour chaque bot — et les implications SEO/GEO de chaque choix.

Illustration minimaliste d'un robot IA avec bouclier d'accès et réseau de nœuds connectés illustrant le contrôle des crawlers robots.txt

Pourquoi votre robots.txt doit évoluer en 2026

En 2022, un robots.txt bien configuré signifiait essentiellement : "Googlebot peut accéder à tout, sauf /admin/ et /checkout/." Le paysage a radicalement changé. Depuis 2023, une nouvelle génération de crawlers IA déferle sur le web : GPTBot (OpenAI, lancé août 2023), ClaudeBot (Anthropic), PerplexityBot, CCBot (Common Crawl), ChatGPT-User, Applebot-Extended… et ce n'est que le début.

Ces bots ont des finalités très différentes de Googlebot. Certains entraînent des modèles de langage (LLM) à partir de votre contenu. D'autres alimentent des réponses en temps réel dans ChatGPT ou Perplexity. Certains construisent des archives publiques du web. Le problème : ils respectent tous le robots.txt — mais si vous ne les avez pas explicitement configurés, votre contenu est accessible à tous par défaut.

En 2026, un robots.txt professionnel ne gère plus 3 bots. Il en gère 20+. Et chaque décision a des implications directes sur votre visibilité SEO traditionnelle et sur votre présence dans les moteurs IA (GEO).


Les 6 crawlers à connaître en 2026

BotSociétéFinalitéUser-AgentRespecte robots.txt
GooglebotGoogleSEO / indexationGooglebot✅ Oui
GPTBotOpenAIEntraînement LLMGPTBot✅ Oui
ClaudeBotAnthropicEntraînement LLMClaudeBot✅ Oui
PerplexityBotPerplexityRéponses IA temps réelPerplexityBot✅ Oui
CCBotCommon CrawlArchive web / datasetsCCBot✅ Oui
ChatGPT-UserOpenAIBrowsing en temps réelChatGPT-User✅ Oui

Quelques précisions importantes :

  • GPTBot est utilisé pour l'entraînement des modèles OpenAI futurs. Le bloquer n'affecte pas les réponses actuelles de ChatGPT, mais influence les versions futures du modèle.
  • ChatGPT-User est distinct : il est utilisé pour le mode "Browsing" de ChatGPT, qui fetche des URLs en temps réel pour répondre aux utilisateurs. Le bloquer peut donc réduire votre visibilité dans les réponses ChatGPT actuelles.
  • ClaudeBot crawle pour les données d'entraînement d'Anthropic. Comme GPTBot, son effet est sur les modèles futurs.
  • PerplexityBot est directement lié aux résultats de Perplexity.ai — le bloquer vous exclut des citations Perplexity.
  • CCBot (Common Crawl) alimente de nombreux datasets open source utilisés pour entraîner des dizaines de modèles IA tiers.

La syntaxe robots.txt : rappel des règles

Le fichier robots.txt suit le protocole d'exclusion des robots (REP). Quelques rappels essentiels avant de passer aux templates.

Structure de base

User-agent: [nom du bot]
Disallow: [chemin bloqué]
Allow: [chemin autorisé]
Crawl-delay: [secondes entre requêtes]

Sitemap: [URL complète du sitemap]

Règles de priorité

  1. Correspondance la plus longue gagne : si vous avez Disallow: /blog/ et Allow: /blog/seo/, le chemin /blog/seo/article est autorisé (règle la plus longue).
  2. L'ordre des blocs n'a pas d'importance pour la priorité, mais la lisibilité recommande de placer les bots prioritaires en premier.
  3. * est un wildcard dans le User-agent uniquement : User-agent: * s'applique à tous les bots non listés explicitement.
  4. Un Disallow vide (Disallow:) signifie "tout est autorisé" pour ce bot.
  5. Les commentaires sont précédés de # et ignorés par les crawlers.

Ce que robots.txt ne fait PAS

  • Il ne garantit pas la non-indexation (une page linkée par un autre site peut apparaître dans Google même si elle est bloquée).
  • Il n'empêche pas les bots malveillants (scrapers, spiders non conformes) — pour cela, il faut du rate-limiting ou un WAF.
  • Il ne protège pas les données sensibles (utilisez l'authentification pour ça).

Templates robots.txt selon votre stratégie

Template 1 — Tout autoriser (SEO maximal + GEO maximal)

Si votre objectif est la visibilité maximale dans tous les moteurs — Google, ChatGPT, Perplexity, etc. — c'est le template par défaut. Idéal pour les éditeurs de contenu, les blogs, les sites de documentation.

# robots.txt — Visibilité maximale SEO + GEO
# Mis à jour : juin 2026

User-agent: *
Disallow: /admin/
Disallow: /checkout/
Disallow: /mon-compte/
Disallow: /api/
Disallow: /search?

Sitemap: https://votre-site.fr/sitemap.xml

Avec ce template, Googlebot, GPTBot, ClaudeBot et PerplexityBot ont tous accès à votre contenu. Vos articles peuvent être cités dans ChatGPT, Perplexity et utilisés pour l'entraînement de futurs modèles.

Template 2 — Bloquer tous les crawlers IA / LLM

Si vous souhaitez préserver votre contenu pour le SEO traditionnel uniquement, en bloquant l'entraînement LLM et les citations IA, utilisez ce template. Adapté aux sites avec du contenu premium, des données propriétaires, ou qui ont des préoccupations sur l'utilisation de leur contenu par les IA.

# robots.txt — SEO classique uniquement, pas de crawl IA
# Mis à jour : juin 2026

# Moteurs de recherche classiques — autorisés
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

User-agent: DuckDuckBot
Allow: /

# Crawlers IA — bloqués
User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: cohere-ai
Disallow: /

# Tout autre bot non listé — accès limité
User-agent: *
Disallow: /admin/
Disallow: /checkout/
Disallow: /api/

Sitemap: https://votre-site.fr/sitemap.xml

Attention : bloquer PerplexityBot vous exclut des citations Perplexity.ai. Bloquer ChatGPT-User réduit votre visibilité dans les réponses ChatGPT en temps réel.

Template 3 — Autorisation sélective (stratégie GEO ciblée)

La stratégie la plus nuancée : autoriser les moteurs qui génèrent du trafic ou de la visibilité, bloquer ceux qui utilisent votre contenu uniquement pour l'entraînement.

# robots.txt — Stratégie GEO sélective
# Mis à jour : juin 2026

# SEO classique — tout autorisé
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

# IA temps réel — autorisés (citations dans ChatGPT et Perplexity)
User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

# Entraînement LLM — bloqués (pas de retour direct pour vous)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: CCBot
Disallow: /

# Défaut pour tous les autres bots
User-agent: *
Disallow: /admin/
Disallow: /checkout/
Disallow: /api/
Disallow: /search?

Sitemap: https://votre-site.fr/sitemap.xml

Cette approche vous permet d'apparaître dans les réponses ChatGPT et Perplexity (qui génèrent du trafic direct) tout en protégeant votre contenu contre l'entraînement passif de modèles IA sans retour pour vous.


Implications SEO/GEO de chaque choix

Bloquer Googlebot

C'est le scénario catastrophe : vous disparaissez des SERPs Google. Ne faites jamais User-agent: Googlebot / Disallow: / sur un site qui dépend du SEO. Même un Disallow: /blog/ sur Googlebot peut faire chuter significativement votre trafic organique.

Bloquer GPTBot

L'impact est indirect et différé. GPTBot crawle pour l'entraînement des futurs modèles OpenAI. Si vous le bloquez, vous n'apparaîtrez pas dans les versions futures de ChatGPT/GPT (dans les réponses générées à partir des données d'entraînement). L'impact court terme est limité ; l'impact à 2–3 ans peut être significatif pour votre autorité dans l'écosystème OpenAI.

Bloquer ChatGPT-User

Impact immédiat : ChatGPT ne peut plus fetcher vos URLs en temps réel lors du mode Browsing. Si un utilisateur demande à ChatGPT "résume cet article" en pointant vers votre URL, il obtiendra une erreur ou une réponse dégradée. Votre site sera moins susceptible d'être cité dans les réponses ChatGPT qui nécessitent une vérification en temps réel.

Bloquer PerplexityBot

Impact direct sur votre visibilité dans Perplexity.ai, qui est l'un des moteurs IA génératifs les plus utilisés en 2026. Si vous ciblez des audiences tech ou des décideurs, Perplexity est souvent leur moteur de recherche privilégié. Bloquer PerplexityBot, c'est accepter de ne pas être cité dans ses réponses.

Bloquer CCBot

CCBot alimente Common Crawl, un dataset public qui sert de base d'entraînement à des dizaines de modèles open source. L'impact sur votre visibilité directe est faible à court terme, mais cela réduit votre présence dans l'ensemble de l'écosystème LLM open source.

Le grand enjeu GEO

Le GEO (Generative Engine Optimization) est la nouvelle discipline qui consiste à optimiser votre contenu pour apparaître dans les réponses des moteurs IA. La visibilité dans ChatGPT, Perplexity ou Google AI Overviews devient aussi stratégique que le classement Google traditionnel. Votre robots.txt est la première ligne de contrôle sur votre présence GEO.


robots.txt vs llms.txt : quelle différence ?

Ces deux fichiers sont complémentaires, pas interchangeables.

Aspectrobots.txtllms.txt
RôleContrôle d'accès : qui peut crawlerGuidance sémantique : quoi comprendre
CibleTous les crawlers (SEO + IA)Principalement les LLM
EffetBloque ou autorise le crawlGuide l'interprétation du contenu
ProtocoleStandard REP (1994, mis à jour)Nouveau standard émergent (2024+)
Emplacement/robots.txt (racine)/llms.txt (racine)

En pratique : le robots.txt décide si un bot peut accéder à votre contenu. Le llms.txt lui indique ce que vous voulez qu'il comprenne de votre site — vos pages clés, votre positionnement, votre expertise.

Un site bien optimisé pour le GEO en 2026 a les deux. Le robots.txt contrôle l'accès sélectif aux crawlers IA, et le llms.txt guide les LLM vers votre meilleur contenu.

Pour tout comprendre sur le llms.txt, consultez notre guide complet llms.txt.


Comment tester votre robots.txt

1. Google Search Console — Testeur de robots.txt

Dans la Search Console, allez dans Paramètres > Testeur robots.txt. Vous pouvez y vérifier qu'une URL spécifique est bien crawlable (ou bloquée) pour Googlebot. C'est l'outil officiel, mais il ne teste que Googlebot.

2. Test manuel avec curl

Pour tester comment un bot spécifique verrait votre robots.txt, simulez son User-Agent :

# Tester avec le User-Agent GPTBot
curl -A "GPTBot" https://votre-site.fr/

# Voir le robots.txt directement
curl https://votre-site.fr/robots.txt

# Vérifier qu'une page est accessible pour PerplexityBot
curl -A "PerplexityBot" -I https://votre-site.fr/blog/mon-article/

3. Outils tiers

  • Screaming Frog : crawl complet avec simulation de User-Agent personnalisé
  • robots.txt Checker (divers outils en ligne) : validation de syntaxe
  • Logs serveur : la méthode la plus fiable pour savoir quels bots crawlent réellement votre site (voir section suivante)

4. Comment voir quels bots crawlent votre site

La meilleure source de vérité : vos logs serveur. Un filtre sur le champ User-Agent de vos logs Apache ou Nginx vous donnera la liste complète des bots qui visitent votre site, leur fréquence, et les URLs qu'ils crawlent.

# Extraire les User-Agents depuis les logs Apache
grep -i "bot|crawler|spider" /var/log/apache2/access.log | awk '{print $12}' | sort | uniq -c | sort -rn | head -20

Révision recommandée : tous les 3 mois minimum. Les nouveaux crawlers IA apparaissent régulièrement, et les User-Agents peuvent changer.


FAQ — robots.txt et crawlers IA

robots.txt protège-t-il vraiment contre les crawlers non respectueux ?

Non. Le robots.txt est une convention basée sur la confiance — les bots bien intentionnés (Googlebot, GPTBot, ClaudeBot, PerplexityBot) le respectent scrupuleusement car leur réputation en dépend. Mais les scrapers malveillants, les bots de spam ou les crawlers non déclarés l'ignorent. Pour une protection réelle contre les bots malveillants, il faut du rate-limiting au niveau du serveur, un WAF (Web Application Firewall), ou des solutions comme Cloudflare Bot Management.

Peut-on bloquer uniquement certaines sections du site pour les IA ?

Oui, c'est exactement l'usage avancé du robots.txt. Vous pouvez par exemple autoriser GPTBot sur votre blog public mais bloquer l'accès à vos contenus premium ou à votre documentation clients :

User-agent: GPTBot
Allow: /blog/
Allow: /ressources-gratuites/
Disallow: /documentation/
Disallow: /espace-clients/
Disallow: /

Comment savoir quels bots crawlent mon site actuellement ?

Trois méthodes : (1) analysez vos logs serveur en filtrant sur les User-Agents contenant "bot", "crawler" ou "spider" ; (2) utilisez Google Search Console pour voir le trafic de Googlebot ; (3) activez des alertes dans votre outil d'analyse de logs (Datadog, Loggly, etc.) pour les nouveaux User-Agents inconnus.

robots.txt est-il suffisant pour le RGPD ?

Non. Le robots.txt n'a aucune valeur juridique au regard du RGPD. Si des données personnelles de vos utilisateurs sont accessibles via des URLs publiques, le bloquer dans robots.txt ne vous protège pas légalement. Pour la conformité RGPD, il faut une authentification et des contrôles d'accès côté serveur. Le robots.txt peut être un signal de bonne foi, mais n'est pas une protection juridique.

Faut-il un fichier llms.txt en plus du robots.txt ?

En 2026, oui — si vous avez une stratégie GEO. Le robots.txt contrôle l'accès (qui peut crawler), mais ne dit rien aux LLM sur ce qui est important dans votre site. Le llms.txt comble ce gap : il guide les moteurs IA vers vos pages clés, explique votre positionnement, et maximise vos chances d'être cité correctement dans les réponses générées. Les deux fichiers sont complémentaires — le robots.txt sécurise l'accès, le llms.txt optimise la compréhension.


Conclusion

Votre robots.txt est le premier fichier que lisent tous les crawlers qui visitent votre site — moteurs de recherche et IA confondus. En 2026, le laisser dans son état de 2022 revient à laisser toutes les portes ouvertes par défaut, sans stratégie.

Trois actions à entreprendre maintenant :

  1. Auditez votre robots.txt actuel : quels bots y figurent ? Lesquels en sont absents ? Comparez avec la liste des crawlers actifs en 2026.
  2. Définissez votre stratégie GEO : voulez-vous apparaître dans ChatGPT, Perplexity ? Acceptez-vous que votre contenu serve à l'entraînement de LLM ? Vos réponses déterminent votre configuration.
  3. Ajoutez un llms.txt pour guider les moteurs IA vers votre meilleur contenu.

Vous voulez savoir exactement comment votre robots.txt est configuré et ce qu'il laisse passer ? Lancez un audit SeAudit — le rapport analyse votre robots.txt, votre crawlabilité, et votre score GEO en quelques minutes.

Reste visible dans l'IA et sur Google — 1 quick-win par semaine.

Chaque semaine, 1 article SEO + GEO tactique + 1 quick-win à appliquer cette semaine sur ton site. Pas de blabla, pas de cross-sell agressif.

Aucun spam. Désinscription en 1 clic. RGPD ✓