Accès des robots IA

Faut-il autoriser GPTBot, ClaudeBot et les autres robots IA dans votre robots.txt ?

Réponse courte : cela dépend du robot, et la distinction ne se fait pas entre « IA » et « pas IA ». Certains robots construisent l'index dans lequel ChatGPT, Claude ou Perplexity choisissent leurs sources. Les bloquer vous prive de citations. D'autres ne servent qu'à entraîner les modèles : les bloquer est un choix éditorial défendable, sans effet direct sur votre visibilité.

Trois familles de robots, trois conséquences

Un fichier robots.txt qui interdit tout ce qui ressemble à de l'IA traite de la même façon des robots qui n'ont ni le même rôle ni les mêmes effets. Avant d'ouvrir ou de fermer quoi que ce soit, il faut savoir lequel fait quoi.

Les robots de citation

Ils construisent l'index dans lequel le moteur va chercher ses sources au moment de répondre. Les bloquer revient à retirer votre site du catalogue : vous ne pouvez plus être cité, quelle que soit la qualité de vos pages.

Les robots d'entraînement

Ils récupèrent du texte pour entraîner les modèles. Les bloquer ne vous fait pas disparaître des réponses en temps réel, mais votre marque et votre vocabulaire n'entrent pas dans la mémoire des modèles, celle qui les fait répondre sans même consulter le web.

Les robots déclenchés par un utilisateur

Ils ne visitent votre site que si quelqu'un colle votre URL dans ChatGPT ou dans Claude. Les bloquer produit un effet immédiat et visible : l'assistant répond à votre prospect qu'il n'a pas pu accéder à la page.

Qui est qui dans votre robots.txt

Les noms de robots ci-dessous sont ceux publiés par OpenAI, Anthropic, Perplexity et Google. Ce sont exactement les chaînes à écrire après User-agent: dans votre fichier.

RobotÉditeurRôleFamille
OAI-SearchBotOpenAIAlimente l'index de recherche de ChatGPT, celui qui décide des sources affichées.Citation
Claude-SearchBotAnthropicIndexe les pages pour améliorer les résultats de recherche servis dans Claude.Citation
PerplexityBotPerplexityConstitue l'index dans lequel Perplexity pioche les sources numérotées sous ses réponses.Citation
GooglebotGoogleExplore le web pour Google Search, dont les AI Overviews et l'AI Mode.Citation
ChatGPT-UserOpenAIVa chercher une page en direct quand un utilisateur demande à ChatGPT de la lire.À la demande
Claude-UserAnthropicMême principe côté Claude : récupération déclenchée par une question d'utilisateur.À la demande
GPTBotOpenAICollecte du contenu susceptible d'entraîner les modèles OpenAI.Entraînement
ClaudeBotAnthropicCollecte du contenu susceptible de contribuer à l'entraînement des modèles.Entraînement
Google-ExtendedGoogleContrôle l'usage du contenu par les applications Gemini et l'API Vertex AI. Sans effet sur Google Search.Entraînement
CCBotCommon CrawlConstitue un corpus public réutilisé par une grande partie des modèles du marché.Entraînement

Google-Extended ne bloque pas les AI Overviews

Bloquer Google-Extended n'empêche pas votre site d'apparaître dans les AI Overviews ni dans l'AI Mode. C'est le malentendu le plus répandu sur le sujet, et il fait prendre de mauvaises décisions dans les deux sens.

Les fonctionnalités génératives de Google Search sont alimentées par l'exploration habituelle de Googlebot. Google-Extended est un contrôle distinct, qui porte sur les applications Gemini et sur l'API Vertex AI. Google indique par ailleurs qu'aucune optimisation particulière n'est requise pour figurer dans les AI Overviews : ce sont les fondamentaux SEO qui s'appliquent, à commencer par une exploration autorisée dans le robots.txt.

Conséquence pratique : si vous voulez sortir des réponses générées par Google, bloquer Google-Extended ne suffira pas. Et si vous l'avez bloqué en croyant protéger votre contenu des AI Overviews, vous avez surtout renoncé à être repris par Gemini.

Sources : Google Search Central, AI features and your website · OpenAI, Overview of OpenAI crawlers · Anthropic, crawling et blocage

Faut-il débloquer ? Cela dépend de ce que vous vendez

La bonne décision ne dépend pas de votre avis sur l'intelligence artificielle, mais de la façon dont votre contenu produit du chiffre d'affaires.

Votre contenu sert à vous faire connaître

Site vitrine, e-commerce, cabinet, agence, éditeur de logiciel : vos pages existent pour amener des clients. Les fermer aux robots IA revient à demander à ne pas être recommandé au moment précis où votre prospect pose la question. Autorisez au minimum les robots de citation, et il n'y a pas de raison solide de bloquer les autres.

Votre contenu est votre produit

Média, base de données, formation, contenu payant : l'arbitrage est réel, et bloquer l'entraînement se défend. Dans ce cas, bloquez les robots d'entraînement et gardez ouverts ceux de citation. Vous restez une source affichée, avec un lien vers votre site, sans nourrir gratuitement les modèles.

Le robots.txt à copier

Deux configurations, selon le cas dans lequel vous vous reconnaissez. Le fichier se trouve à la racine de votre site, à l'adresse votre-domaine.fr/robots.txt.

Priorité à la visibilité

Le cas de la grande majorité des entreprises. Il suffit de retirer les lignes qui bloquent ces robots.

User-agent: *
Allow: /

# Aucune ligne Disallow visant GPTBot, ClaudeBot,
# OAI-SearchBot, PerplexityBot, Google-Extended ou CCBot.
Sitemap: https://votre-domaine.fr/sitemap.xml

Citation autorisée, entraînement refusé

Pour un éditeur qui vit de son contenu. Vous restez cité, avec le lien, sans alimenter l'entraînement.

# Refus de l'entraînement
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Citation et recherche : autorisées
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Googlebot
Allow: /

Un blocage peut venir d'ailleurs que du robots.txt. Beaucoup d'hébergeurs, de CDN et de pare-feu applicatifs filtrent les robots IA par défaut, parfois sans le dire. Si votre fichier est propre et que les robots n'accèdent toujours pas au site, regardez du côté de Cloudflare et des règles de sécurité de votre hébergement.

Comment vérifier que c'est corrigé

Ouvrez votre-domaine.fr/robots.txt dans un navigateur et cherchez les noms de robots listés plus haut. Une ligne Disallow: / sous l'un de ces user-agents suffit à fermer la porte.

Le changement est pris en compte au passage suivant du robot, en général sous quelques jours. Retrouver une place dans les réponses générées prend plus longtemps : le temps que le moteur réindexe vos pages et que votre contenu redevienne un candidat crédible sur vos sujets.

BotSEO contrôle cet accès à chaque audit et vous alerte dès qu'un robot est bloqué. Vous pouvez aussi mesurer la suite : suivre vos citations dans les IA et travailler votre référencement génératif.

Stéphane Delgado, fondateur de BotSEO
Écrit par
Stéphane Delgado

Fondateur de BotSEO, consultant SEO et GEO. Il conçoit des outils d'agents IA pour aider les entreprises à se classer sur Google et à être citées par les moteurs génératifs.

En savoir plus sur l'auteur