Si votre site est public, des robots d'IA le lisent très probablement déjà. Certains sites les ont tous bloqués, parfois sans le savoir, via leur hébergeur ou leur CDN. Pour une entreprise qui veut être recommandée par ChatGPT, Claude, Perplexity, Gemini ou Copilot, c'est une erreur coûteuse : un moteur qui ne peut pas lire vos pages ne peut pas les citer. Les chercheurs qui ont formalisé le GEO (Aggarwal et al., KDD 2024) mesurent jusqu'à 40 % de visibilité en plus dans les réponses des moteurs génératifs, avec des résultats variables selon les domaines. Encore faut-il que le moteur accède à vos contenus : c'est l'objet de ce guide, complément de notre guide complet du GEO.
Trois familles de robots, trois décisions
Les éditeurs documentent désormais trois usages distincts. Les confondre conduit à bloquer ce qui vous rend visible pour protéger ce qui n'était pas menacé.
- L'entraînement (GPTBot, ClaudeBot, CCBot) : collecte de pages publiques pour entraîner les futurs modèles. Les refuser exclut vos futurs contenus des données d'entraînement, pas votre entreprise des réponses.
- L'indexation pour la recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot) : l'index dans lequel les assistants puisent leurs sources quand ils répondent avec des liens. L'équivalent de Googlebot pour les réponses des IA.
- La visite à la demande d'un utilisateur (ChatGPT-User, Claude-User, Perplexity-User) : un utilisateur demande à l'assistant de lire une page, ou celui-ci vérifie une information en direct. OpenAI et Perplexity précisent que ces agents n'explorent pas le web de façon automatique.
Tableau de référence des principaux robots IA
Synthèse des documentations officielles de chaque éditeur, consultées en septembre 2026. La colonne robots.txt reprend leurs propres termes.
| Robot (nom dans robots.txt) | Éditeur | Rôle | Respecte robots.txt ? | Si vous le bloquez |
|---|---|---|---|---|
| GPTBot | OpenAI | Entraînement | Oui | Contenus signalés comme exclus de l'entraînement ; ChatGPT search non concerné |
| OAI-SearchBot | OpenAI | Recherche de ChatGPT | Oui | Absent des réponses de ChatGPT search (au mieux simple lien de navigation) |
| ChatGPT-User | OpenAI | Actions d'un utilisateur dans ChatGPT et les GPTs | Les règles « peuvent ne pas s'appliquer » | Non garanti |
| ClaudeBot | Anthropic | Entraînement | Oui | Futurs contenus exclus de l'entraînement |
| Claude-SearchBot | Anthropic | Recherche de Claude | Oui | Visibilité réduite dans ses résultats |
| Claude-User | Anthropic | Lecture d'une page pour un utilisateur | Oui | Claude ne peut plus lire vos pages pour ses utilisateurs |
| PerplexityBot | Perplexity | Recherche (pas d'entraînement de modèles de fondation) | Oui | Plus mis en avant ni lié dans Perplexity |
| Perplexity-User | Perplexity | Lecture d'une page pour un utilisateur | « Ignore généralement » les règles | Non garanti |
| Googlebot | Google Search, AI Overviews et AI Mode compris | Oui | Absent de Google, fonctions IA comprises | |
| Google-Extended | Jeton de contrôle : entraînement de Gemini et ancrage des réponses dans l'app Gemini et Vertex AI | Oui | Aucun effet sur Google Search ; exclu de l'ancrage dans l'app Gemini | |
| Applebot-Extended | Apple | Jeton de contrôle : entraînement des modèles d'Apple | Oui | Pages maintenues dans Spotlight, Siri et Safari |
| CCBot | Common Crawl | Archive ouverte du web, très utilisée pour l'entraînement | Oui | Futures pages absentes de l'archive |
| meta-externalagent | Meta | Entraînement de modèles ou indexation pour des produits Meta | Oui (un Disallow le bloque) | Exclu de ces deux usages |
| bingbot | Microsoft | Index de Bing, réutilisé dans Copilot | Oui | Absent de Bing ; NOARCHIVE suffit pour sortir des seules réponses de Copilot |
À noter : Meta documente aussi Meta-WebIndexer (recherche de Meta AI) et Meta-ExternalFetcher (liens demandés par un utilisateur, qui « peut contourner » le robots.txt). Applebot suit vos règles Googlebot s'il n'est pas nommé. Et selon Common Crawl, son archive fournit environ 70 à 90 % des tokens d'entraînement de la quasi-totalité des grands modèles de langage.
Bloquer l'entraînement n'est pas disparaître des réponses
OpenAI l'écrit noir sur blanc : chaque réglage est indépendant, et un site peut autoriser OAI-SearchBot pour apparaître dans la recherche tout en refusant GPTBot pour l'entraînement. Anthropic sépare de la même façon ClaudeBot, Claude-SearchBot et Claude-User.
Chez Google, la frontière passe ailleurs. Selon Google, Google-Extended n'a aucun effet sur l'inclusion dans Google Search ni sur le classement ; il couvre l'entraînement de Gemini, mais aussi l'ancrage (grounding) des réponses dans l'application Gemini. Pour les AI Overviews et AI Mode, Google rappelle que l'IA fait partie intégrante de Search : c'est Googlebot qui sert de contrôle. Bloquer Google-Extended ne vous en retire donc pas. Pour en sortir, Google propose depuis le 31 août 2026, dans le monde entier, le réglage « Search generative AI » de la Search Console (Paramètres) : il exclut votre site des AI Overviews, d'AI Mode et des fonctions d'IA générative de Discover, sans effet sur le classement dans la recherche classique. Les balises nosnippet, max-snippet et noindex restent des contrôles plus larges, qui touchent aussi vos résultats classiques.
Chez Apple, Applebot-Extended refuse l'entraînement sans toucher à Spotlight, Siri ou Safari. Chez Microsoft, la balise meta NOARCHIVE exclut une page des réponses de Bing Chat (devenu Copilot) et de l'entraînement, tout en la laissant dans Bing.
À retenir : refuser l'entraînement est un choix éditorial légitime. Refuser la recherche et les visites des utilisateurs est un choix de visibilité, presque toujours involontaire.
robots.txt : la règle de groupe qui piège tout le monde
Un robots.txt est une suite de groupes : une ou plusieurs lignes User-agent, puis des règles Allow et Disallow. La norme (RFC 9309), Google et Bing s'accordent sur l'essentiel :
- Un robot n'obéit qu'à un seul groupe, celui qui le nomme le plus précisément. Un groupe nommé remplace donc le groupe *, il ne s'y ajoute pas.
- Les noms de robots ignorent la casse, pas les chemins :
/Admin/et/admin/diffèrent. - La règle la plus précise l'emporte ; à égalité, Allow gagne.
User-agent: *
Disallow: /admin/
Disallow: /panier/
# Erreur : ce groupe remplace le groupe * pour OAI-SearchBot,
# qui peut désormais explorer /admin/ et /panier/.
User-agent: OAI-SearchBot
Allow: /Enfin, la norme le dit elle-même : ces règles ne sont pas une forme d'autorisation d'accès. Une page confidentielle se protège par un mot de passe.
Trois configurations robots.txt commentées
Remplacez l'URL du sitemap par la vôtre et comptez environ 24 heures de prise en compte : c'est le délai qu'indiquent OpenAI et Perplexity, et Google garde généralement le fichier en cache jusqu'à 24 heures.
Stratégie 1 : tout autoriser
# Tous les robots, IA compris, peuvent lire le site public.
User-agent: *
Allow: /
Disallow: /admin/
Sitemap: https://www.votre-site.fr/sitemap.xmlNotre choix par défaut pour un site vitrine ou de services : aucun robot n'est nommé, tous suivent le même groupe.
Stratégie 2 : autoriser la recherche, refuser l'entraînement
# Règles communes : recherche et visites des utilisateurs autorisées.
User-agent: *
Allow: /
Disallow: /admin/
# Entraînement de modèles : refusé.
# Ces robots ont leur propre groupe et ne suivent plus le groupe *.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /
# À arbitrer avant de décommenter :
# - Google-Extended couvre aussi l'ancrage des réponses dans l'app Gemini ;
# - meta-externalagent sert aussi à l'indexation pour des produits Meta.
# User-agent: Google-Extended
# User-agent: meta-externalagent
# Disallow: /
Sitemap: https://www.votre-site.fr/sitemap.xmlLes robots de recherche, non nommés, suivent le groupe * et restent autorisés.
Stratégie 3 : bloquer les robots IA (déconseillé pour une PME)
User-agent: *
Allow: /
Disallow: /admin/
# Principaux robots IA documentés (liste à revoir chaque trimestre) : entraînement, recherche et utilisateurs.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
User-agent: Meta-WebIndexer
User-agent: Meta-ExternalFetcher
Disallow: /Deux limites : ChatGPT-User, Perplexity-User et Meta-ExternalFetcher ne s'engagent pas à respecter ces règles, et Googlebot n'est pas concerné, donc vos pages restent éligibles aux AI Overviews, sauf si vous activez l'exclusion dans le réglage « Search generative AI » de la Search Console. À réserver aux éditeurs dont le contenu est le produit (presse, études payantes).
Les pièges qui bloquent les IA à votre insu
Bloquer /_next/, les scripts ou les feuilles de style
Interdire /_next/ (Next.js), /wp-includes/ (WordPress) ou les fichiers .js et .css empêche Googlebot d'afficher correctement vos pages. Google demande de ne pas bloquer ces ressources quand elles aident à comprendre la page, et c'est Googlebot qui alimente les AI Overviews.
Le pare-feu ou le CDN qui filtre les robots IA
Un blocage réseau passe avant le robots.txt : le robot reçoit une erreur 403 sans lire vos règles. Depuis juillet 2025, Cloudflare demande à chaque nouveau domaine, dès l'inscription, s'il autorise les robots d'IA. Depuis le 15 septembre 2026, il propose trois réglages indépendants (recherche, entraînement, agents) et, à l'ajout d'un nouveau domaine, une configuration recommandée selon le modèle économique : pour un site financé par la publicité, l'entraînement est refusé via robots.txt (Disallow AI Training) et les agents d'IA sont bloqués sur les pages qui affichent des publicités. Or ces agents, ce sont les visites déclenchées par vos futurs clients depuis ChatGPT ou Claude. Attention aussi : choisir « Block » (ou « Block on pages with ads ») pour l'entraînement bloque désormais aussi Googlebot, Bingbot et Applebot, donc la recherche ; pour refuser l'entraînement sans perdre la recherche, Cloudflare recommande « Disallow AI Training ». Vérifiez ces réglages après chaque migration.
L'adresse e-mail masquée par un script
L'option Email Address Obfuscation de Cloudflare, activée par défaut, remplace chaque adresse par un lien décodé en JavaScript. En préparant cet article avec un outil qui, comme la plupart des robots d'IA, n'exécute pas le JavaScript, nous avons trouvé une documentation officielle dont l'adresse de contact se lisait « [email protected] ». Exemptez au moins vos pages contact et mentions légales.
Le contenu affiché uniquement en JavaScript
Selon une analyse de Vercel (décembre 2024), aucun des principaux robots d'IA observés (OpenAI, Anthropic, Meta, ByteDance, Perplexity) n'exécutait le JavaScript ; seuls Gemini, via Googlebot, et Applebot le faisaient. Si vos prix ou votre FAQ n'apparaissent qu'après un script, ces robots voient une page vide. Vérifiez le HTML servi :
# Le texte clé est-il présent dans le HTML servi, sans JavaScript ?
curl -s https://www.votre-site.fr/tarifs | grep -i "votre phrase clé"Les sites Next.js récents rendent les pages côté serveur par défaut, tout comme WordPress, qui génère ses pages en PHP — à condition que le thème ne charge pas les contenus clés par script.
Les sous-domaines
Chaque hôte a besoin de son propre robots.txt : blog.votre-site.fr n'hérite pas de celui de votre-site.fr, comme le rappellent Anthropic et Google.
Vérifier dans vos journaux serveur
Seuls vos journaux d'accès (hébergeur ou CDN) disent ce que font réellement les robots.
- Comptez les passages de chaque robot (commande ci-dessous).
- Lisez les codes de réponse : 200, page servie ; 403 ou 429, blocage par un pare-feu ou une limite de débit.
- Vérifiez l'identité : un user-agent peut être usurpé. OpenAI, Anthropic, Perplexity et Common Crawl publient les adresses IP de leurs robots ; Google documente une vérification par DNS inverse.
- Suivez les citations : dans la Search Console, les rapports de performances « Search generative AI », disponibles dans le monde entier depuis le 31 août 2026, mesurent vos impressions dans les AI Overviews et AI Mode ; le rapport AI Performance de Bing Webmaster Tools, en préversion depuis février 2026, compte les citations de vos pages dans Copilot, les résumés IA de Bing et certains services partenaires.
# Nombre de passages par robot IA dans un journal d'accès
grep -ioE "gptbot|oai-searchbot|chatgpt-user|claudebot|claude-searchbot|claude-user|perplexitybot|perplexity-user|ccbot|meta-externalagent|bingbot" access.log \
| tr 'A-Z' 'a-z' | sort | uniq -c | sort -rnGoogle-Extended et Applebot-Extended n'y figureront jamais : ce sont des jetons de contrôle, pas des visiteurs.
Notre recommandation pour une PME qui veut être recommandée par les IA
Laissez passer tout ce qui peut vous faire citer avec un lien, et traitez l'entraînement à part :
- Autorisez les robots de recherche : Googlebot, bingbot, Applebot, OAI-SearchBot, Claude-SearchBot, PerplexityBot.
- Autorisez les visites des utilisateurs : ChatGPT-User, Claude-User, Perplexity-User. Ce sont vos prospects qui demandent à un assistant de lire votre page.
- Arbitrez l'entraînement. Aucune documentation ne lie le blocage de GPTBot ou de ClaudeBot à une baisse de visibilité dans les réponses, ni l'inverse. Pour un site vitrine, nous laissons généralement passer ; pour des contenus à valeur marchande, refuser est légitime. Gardez Google-Extended ouvert si l'app Gemini compte pour vous.
L'accès n'est que la première marche : viennent ensuite des contenus citables, des informations cohérentes sur votre entreprise et, en complément, un fichier llms.txt. Ce dernier reste une proposition de Jeremy Howard (2024), pas un standard officiel, et Google indique qu'aucun fichier spécial n'est nécessaire pour ses fonctions IA : voir notre article sur le fichier llms.txt.
Checklist : vos robots IA en 10 points
- Aucun
Disallow: /visant Googlebot, bingbot, OAI-SearchBot, Claude-SearchBot ou PerplexityBot. - Chaque groupe nommé reprend les règles utiles du groupe *.
- Aucun blocage de
/_next/, des fichiers .js ou .css. - Un choix explicite pour GPTBot, ClaudeBot, CCBot, Applebot-Extended, Google-Extended et meta-externalagent.
- Réglages IA du CDN ou du pare-feu vérifiés.
- Pages contact et mentions légales exclues de l'obfuscation d'e-mails.
- Prix, services, adresse et FAQ présents dans le HTML servi.
- Un robots.txt par sous-domaine.
- Journaux relus 24 à 48 heures après chaque modification.
- Un point trimestriel : nouveaux robots, documentations mises à jour.
Ce que fait Agence Zen. Nous traitons l'accès des robots comme un prérequis technique du GEO : robots.txt rédigé par usage, pages rendues côté serveur (Next.js ou WordPress avec un thème codé à la main), réglages du CDN et de l'obfuscation vérifiés, puis données structurées et llms.txt. Le socle GEO (données structurées, llms.txt, FAQ rédigée pour être citée) est inclus dès l'offre Essentiel, le GEO complet dans l'offre Signature, et nos accompagnements SEO & GEO ajoutent un suivi mensuel de ce que répondent les IA sur votre entreprise. Le tout à distance, en visio. Découvrir notre accompagnement SEO & GEO.
Questions fréquentes
Faut-il bloquer GPTBot ?
Seulement si vous refusez que vos contenus servent à entraîner les modèles d'OpenAI. Selon OpenAI, GPTBot sert à l'entraînement, tandis que la recherche de ChatGPT repose sur OAI-SearchBot, réglé indépendamment. Bloquer GPTBot n'empêche donc pas d'apparaître dans ChatGPT search, à condition de laisser passer OAI-SearchBot. Pour une PME qui cherche de la visibilité, ce n'est pas une nécessité.
Bloquer Google-Extended me retire-t-il des AI Overviews ?
Non. Google indique que Google-Extended n'a aucun effet sur l'inclusion dans Google Search et ne sert pas de signal de classement. Il concerne l'entraînement des futurs modèles Gemini et l'ancrage des réponses dans l'application Gemini et Vertex AI. Pour sortir des AI Overviews et d'AI Mode sans quitter Google, utilisez le réglage « Search generative AI » de la Search Console, disponible dans le monde entier depuis le 31 août 2026 ; il n'affecte pas le classement dans la recherche classique.
Les robots IA respectent-ils tous le robots.txt ?
Non. D'après leurs documentations, GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, Claude-User et PerplexityBot le respectent. OpenAI précise en revanche que les règles peuvent ne pas s'appliquer à ChatGPT-User, et Perplexity que Perplexity-User les ignore généralement, car ces visites sont déclenchées par un utilisateur. Le robots.txt reste une consigne, pas une protection.
Pourquoi mon site n'apparaît-il pas dans ChatGPT alors que mon robots.txt autorise tout ?
Le blocage vient souvent d'ailleurs : pare-feu ou CDN qui filtre les robots d'IA, contenu affiché uniquement en JavaScript, adresse e-mail masquée par un script, ou simple manque d'autorité du site. Commencez par vos journaux serveur. Si OAI-SearchBot reçoit des réponses 403, le problème est technique. S'il lit vos pages, le travail porte sur le contenu et la notoriété.
Quelle configuration recommandez-vous pour une PME ?
Autorisez les robots de recherche (Googlebot, bingbot, Applebot, OAI-SearchBot, Claude-SearchBot, PerplexityBot) et ceux qui visitent votre site à la demande d'un utilisateur (ChatGPT-User, Claude-User, Perplexity-User) : ce sont eux qui permettent d'être cité avec un lien. L'entraînement est un choix d'entreprise. Pour un site vitrine, nous le laissons généralement ouvert ; pour des contenus payants ou exclusifs, le refuser est légitime.
Sources
- OpenAI : robots d'OpenAI
- Anthropic : robots d'Anthropic et blocage
- Perplexity : robots de Perplexity
- Google : robots courants (Google-Extended), fonctionnalités d'IA et votre site, réglage Search generative AI de la Search Console, rapports de performances Search generative AI,spécification robots.txt, introduction au robots.txt, vérifier Googlebot
- Apple : About Applebot
- Common Crawl : CCBot, FAQ, consultation britannique sur le droit d'auteur et l'IA
- Meta : robots de Meta
- Microsoft Bing : NOCACHE et NOARCHIVE dans Bing Chat, Bing Chat devient Copilot, bingbot et robots.txt, AI Performance
- IETF : RFC 9309, Robots Exclusion Protocol
- Cloudflare : annonce de juillet 2025, annonce de septembre 2026, nouveaux réglages de septembre 2026,Block AI bots, Email Address Obfuscation
- Vercel : The rise of the AI crawler (2024)
- llmstxt.org et Aggarwal et al., GEO: Generative Engine Optimization (KDD 2024)
Votre site est-il lisible par les IA ?
Parlons de votre visibilité dans les réponses des IA lors d'un appel découverte de 30 minutes, en visio, avec le fondateur.
Réserver un appel découverte→
