Guide

robots.txt crawlers IA, quels jetons autoriser et lesquels bloquer

Un fichier robots.txt ne parle pas à l'intelligence artificielle en général, il parle à des jetons user-agent précis, avec des conséquences différentes selon qu'ils alimentent une recherche, un entraînement, une requête lancée par un internaute ou un agent. Nous avons vérifié chaque jeton dans la documentation officielle de son propriétaire le 14 août 2026.

Timothé Merle20 min de lectureMis à jour le 14 août 2026
En bref

Les crawlers IA ne forment pas un bloc. OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot et bingbot alimentent des réponses qui citent votre site, les bloquer vous fait disparaître de ces réponses. GPTBot, Google-Extended, Applebot-Extended, ClaudeBot et Meta-ExternalAgent servent surtout l'entraînement, les bloquer est un arbitrage éditorial sans effet direct sur votre visibilité. ChatGPT-User, Perplexity-User et Meta-ExternalFetcher agissent à la demande d'un internaute et ne suivent pas toujours robots.txt. Enfin, robots.txt reste une préférence publique appliquée volontairement, un user-agent se falsifie, donc tout blocage réellement contraignant passe par une vérification d'adresse IP au niveau du serveur ou du pare-feu applicatif.

Réponse directe

Quels crawlers IA faut-il autoriser dans robots.txt ?

Autorisez les crawlers qui alimentent des réponses citant votre site, arbitrez ceux qui servent l'entraînement. Concrètement, laissez passer OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot et bingbot si vous cherchez de la visibilité. Décidez ensuite, contenu par contenu, pour GPTBot, ClaudeBot, Google-Extended, Applebot-Extended et Meta-ExternalAgent.

Cette séparation est écrite dans les documentations officielles, et elle vaut d'un fournisseur à l'autre. OpenAI la formule ainsi sur sa page dédiée aux robots, chaque réglage est indépendant des autres, un site peut autoriser OAI-SearchBot pour apparaître dans les résultats de recherche tout en interdisant GPTBot afin de signaler que le contenu exploré ne doit pas servir à entraîner ses modèles de fondation. Google décrit le même découplage dans l'autre sens, puisque Google-Extended pilote l'usage de votre contenu pour l'entraînement de Gemini sans toucher à votre présence dans la Recherche. Le raisonnement utile n'est donc jamais d'autoriser ou de bloquer l'IA, mais de savoir quel usage vous acceptez, pour quel opérateur, et à quel prix pour votre visibilité.

Une précision compte avant d'écrire la moindre ligne. Un blocage n'efface pas le passé, un contenu déjà exploré et déjà absorbé par un modèle reste dans ce modèle. Le fichier robots.txt exprime une préférence pour les visites à venir, rien de plus.

  • Objectif visibilité, autorisez toute la famille recherche et laissez passer les récupérations demandées par un internaute.
  • Objectif protection éditoriale, bloquez la famille entraînement jeton par jeton, en gardant la famille recherche ouverte.
  • Contenu confidentiel, ne comptez jamais sur robots.txt, un fichier public qui affiche justement les chemins que vous voulez cacher. Utilisez une authentification.
  • Dans tous les cas, vérifiez le résultat réel sur votre domaine plutôt que de faire confiance au fichier que vous croyez avoir publié.

OpenAI, vue d'ensemble des robots | Google, crawlers courants

Testez votre fichier. Vérificateur d'accès des crawlers IA | Simulateur de crawler IA

Cadrage

Recherche, entraînement, requête utilisateur et agent

Quatre familles de robots se partagent aujourd'hui le trafic dit IA, et confondre ces familles produit la majorité des mauvaises décisions que nous voyons en audit. Une même entreprise opère souvent un jeton par famille, avec des règles de respect de robots.txt différentes pour chacun.

La famille agent est la plus récente. Google publie désormais un fichier d'adresses IP dédié aux agents déclenchés par un utilisateur, à côté de celui des explorateurs classiques, et Meta décrit un robot qui aide son IA à naviguer sur des sites pour accomplir une tâche. Ces clients ressemblent à un internaute plus qu'à un moteur, ce qui rend le blocage par robots.txt inopérant et le blocage par pare-feu risqué.

Familles de robots IA et traitement de robots.txt, sources OpenAI, Anthropic, Perplexity, Google et Meta, vérifiées le 14 août 2026.
FamilleJetons typiquesrobots.txtCe que vous jouez
Recherche et citationOAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot, bingbotRespectéVotre présence dans les réponses générées et dans les liens qui les accompagnent
EntraînementGPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgentRespectéL'usage de votre contenu comme donnée d'apprentissage, sans effet direct sur la visibilité
Requête lancée par un internauteChatGPT-User, Claude-User, Perplexity-User, Meta-ExternalFetcherPartiellement, souvent ignoréLa lecture d'une page qu'un utilisateur a explicitement demandée
AgentGoogle-Agent, Meta-ExternalFetcher, Google-CloudVertexBotGénéralement ignoréL'exécution d'une tâche pour un utilisateur, formulaire et parcours inclus

Google, récupérateurs déclenchés par un utilisateur | Meta, robots d'exploration

Pour aller plus loin. Préparer votre site pour les agents IA

Référence

Les jetons OpenAI, Anthropic et Perplexity, vérifiés un par un

Le tableau ci-dessous reprend les jetons exacts tels qu'ils apparaissent dans la documentation de leur propriétaire, avec la conséquence réelle d'un blocage. Les recommandations sont indicatives, elles supposent un site qui cherche de la visibilité commerciale.

Jetons OpenAI, Anthropic et Perplexity relevés dans la documentation officielle le 14 août 2026.
JetonPropriétaireFinalitérobots.txtSi vous bloquezRecommandation
OAI-SearchBotOpenAIRecherche dans ChatGPTRespectéLe site n'apparaît plus dans les réponses de recherche ChatGPT, il peut rester un lien de navigationAutoriser
GPTBotOpenAIEntraînement des modèles de fondationRespectéLe contenu n'est plus utilisé pour l'entraînement, aucune perte de visibilité immédiateArbitrage éditorial
ChatGPT-UserOpenAIVisite déclenchée par la question d'un utilisateurPeut ne pas s'appliquerLa page qu'un utilisateur a demandée ne peut pas être lueLaisser passer
OAI-AdsBotOpenAIContrôle des pages soumises comme publicitésRespectéVos pages publicitaires ne peuvent pas être validéesAutoriser si vous achetez de la publicité
ClaudeBotAnthropicCollecte pour les jeux de données d'entraînementRespecté, Crawl-delay acceptéLe contenu n'alimente plus l'entraînementArbitrage éditorial
Claude-SearchBotAnthropicQualité des résultats de rechercheRespectéMoins de chances que vos pages soient retenues comme sourceAutoriser
Claude-UserAnthropicAccès à une page pendant une conversationRespectéLa page demandée par l'utilisateur n'est pas lueLaisser passer
PerplexityBotPerplexityIndexation pour afficher et lier des sites dans les résultatsRespectéLe site sort de l'index qui alimente les réponsesAutoriser
Perplexity-UserPerplexityVisite déclenchée par la question d'un utilisateurGénéralement ignoréUn blocage ne peut passer que par le serveur ou le pare-feuLaisser passer
Documentation officielle OpenAI listant les robots OAI-SearchBot, GPTBot, ChatGPT-User et OAI-AdsBot
Page officielle Overview of OpenAI Crawlers, consultée le 14 août 2026. OpenAI y écrit que chaque réglage est indépendant des autres, et qu'un site peut autoriser OAI-SearchBot tout en interdisant GPTBot. La même page précise qu'il faut compter environ 24 heures après une modification de robots.txt pour que la recherche s'ajuste.

OpenAI, robots et user-agents | Anthropic, exploration du web | Perplexity, robots

Référence

Les jetons Google, Apple, Meta et Microsoft

Chez Google, la nuance est structurante. Les aperçus IA et le mode IA sont servis à partir de la Recherche, et la documentation indique que l'intelligence artificielle est intégrée à la Recherche, ce qui fait des directives robots.txt adressées à Googlebot le levier de contrôle des propriétaires de site. Autrement dit, aucun jeton ne vous retire des surfaces IA de Google en vous laissant dans les liens bleus. Google-Extended, lui, ne touche ni votre présence dans la Recherche ni votre classement, il décide seulement si votre contenu peut entraîner Gemini et servir d'ancrage dans les applications Gemini. Apple et Microsoft raisonnent différemment, avec un contrôle à deux étages. Chez Apple, Applebot explore pour Spotlight, Siri et Safari, tandis qu'Applebot-Extended sert uniquement à refuser l'entraînement. Chez Microsoft, ce sont les balises NOCACHE et NOARCHIVE qui limitent l'usage conversationnel du contenu, sans le sortir de l'index Bing.

Jetons Google, Apple, Meta et Microsoft relevés dans la documentation officielle le 14 août 2026.
JetonPropriétaireFinalitérobots.txtSi vous bloquezRecommandation
GooglebotGoogleRecherche, Discover, aperçus IA et mode IA, servis depuis la RechercheRespectéDisparition de Google Search et donc des surfaces IA associéesAutoriser
Google-ExtendedGoogleUsage du contenu pour entraîner Gemini et pour l'ancrage dans les applications GeminiRespectéAucun effet sur la Recherche ni sur le classement, seul l'usage Gemini est retiréArbitrage éditorial
Google-CloudVertexBotGoogleConstruction des agents Vertex AIRespectéVos pages ne nourrissent plus les agents construits par vos clients ou partenairesSelon vos cas clients
Google-AgentGoogleAgents exécutant une tâche demandée par un utilisateurGénéralement ignoréUn blocage doit se faire au niveau du serveurLaisser passer
ApplebotAppleRecherche intégrée à Spotlight, Siri et SafariRespectéSortie des résultats de recherche de l'écosystème AppleAutoriser
Applebot-ExtendedAppleJeton de refus pour l'entraînement des modèles de fondation AppleRespectéLe contenu reste exploré par Applebot mais sort de l'entraînementArbitrage éditorial
Meta-ExternalAgentMetaEntraînement de modèles et indexation de contenuRespectéExclusion des jeux de données MetaArbitrage éditorial
Meta-ExternalFetcherMetaRécupération d'un lien à la demande d'un utilisateur, usages agentiques comprisPeut être contournéBlocage fiable uniquement côté serveurLaisser passer
bingbotMicrosoftIndex Bing, qui alimente aussi CopilotRespectéSortie de Bing et des réponses Copilot associéesAutoriser
  • Microsoft ne passe pas seulement par robots.txt. Les balises NOCACHE et NOARCHIVE décrites sur le blog Bing Webmaster limitent l'usage du contenu dans les réponses conversationnelles tout en gardant le site dans les résultats de recherche.
  • Apple applique la même logique à deux étages. Applebot-Extended retire votre contenu de l'entraînement, et la balise nosnippet le retire des réponses de connaissance générale, sans vous sortir de Spotlight, Siri et Safari.
  • Un jeton absent de la documentation d'un éditeur circule parfois dans des listes toutes faites. Nous ne le reprenons pas ici tant qu'une source officielle ne le confirme pas.

Google, fonctionnalités IA et votre site | Apple, à propos d'Applebot | Bing Webmaster Blog, contrôles de contenu

Conséquences

Que se passe-t-il vraiment quand vous bloquez un crawler ?

Le blocage produit trois effets très différents selon la famille visée, et c'est la seule grille qui évite les décisions regrettées six mois plus tard. Bloquer un robot de recherche vous retire des réponses où vous auriez pu être cité, immédiatement et de façon visible, OpenAI précise même que ses systèmes mettent environ vingt-quatre heures à intégrer un changement de robots.txt. Bloquer un robot d'entraînement ne change rien à votre visibilité du jour au lendemain, c'est un arbitrage sur l'usage futur de votre contenu, et il n'annule pas les apprentissages déjà réalisés. Bloquer un récupérateur déclenché par un internaute revient à casser une demande explicite, quelqu'un a collé votre lien dans une conversation et attend une réponse pendant que votre serveur renvoie une erreur. Ce troisième cas est le plus coûteux et le plus rarement anticipé.

Un quatrième effet est souvent oublié, celui du signal donné aux autres. Un fichier robots.txt est public, il est lu, archivé et comparé. Fermer massivement une famille alors que vos concurrents restent ouverts revient à leur céder la place de source citée, sans compensation tant que vous n'avez pas de contrat de licence.

  • Bloquer GPTBot ne vous retire pas de la recherche ChatGPT, c'est OAI-SearchBot qui gouverne cette surface.
  • Bloquer Google-Extended ne vous retire ni des aperçus IA ni du mode IA, qui dépendent de Googlebot et de la Recherche.
  • Bloquer Googlebot vous retire de la Recherche et donc, mécaniquement, des surfaces IA de Google.
  • Bloquer un robot d'entraînement n'efface pas ce qui a déjà été appris de votre contenu.
  • Un blocage mal écrit peut annuler d'autres règles, un robot n'appliquant que le groupe le plus spécifique qui le concerne.

Guides liés. Apparaître dans AI Overviews | Être cité par Perplexity

Technique

La syntaxe qui compte vraiment dans robots.txt

Le protocole d'exclusion des robots est normalisé depuis septembre 2022 par la RFC 9309, un document sur la voie des standards, ce qui met fin à vingt-cinq ans de conventions informelles. La norme couvre les lignes user-agent, les règles allow et disallow, et les caractères spéciaux de correspondance de chemin. Elle demande aussi une limite d'analyse d'au moins 500 kibioctets et un cache qui ne dépasse pas vingt-quatre heures.

Trois règles expliquent la quasi-totalité des fichiers cassés que nous rencontrons. Un robot n'applique qu'un seul groupe, le plus spécifique qui le nomme, donc déclarer un groupe pour GPTBot annule pour lui les règles du groupe étoile. Le fichier vaut pour un couple protocole, hôte et port précis, donc chaque sous-domaine a besoin de son propre fichier, et Anthropic le rappelle explicitement pour chaque sous-domaine que vous voulez exclure. Enfin robots.txt régit l'exploration, pas l'indexation ni l'affichage, ces deux points se pilotant avec les balises meta robots.

Fichier robots.txt de tryhikoo.com ouvert dans un navigateur, avec le détail des groupes de crawlers IA
Le fichier robots.txt de tryhikoo.com, vérifié le 14 août 2026 avec une requête GET qui renvoie un code HTTP 200 et un content-type text/plain pour 445 octets. Le bandeau sombre en haut est une annotation ajoutée par nos soins, le reste est le fichier tel qu'il est servi. Il illustre une structure à groupes explicites, avec un groupe étoile puis un groupe par jeton IA.
  • Placez le fichier à la racine du domaine, en clair, servi en text/plain.
  • Écrivez un groupe étoile qui porte vos règles générales et votre ligne Sitemap.
  • Ajoutez un groupe par jeton seulement quand vous voulez un traitement différent, et recopiez-y les règles générales dont ce jeton a besoin.
  • Répétez l'opération sur chaque sous-domaine, y compris les sous-domaines techniques qui servent du contenu public.
  • Relisez le fichier après déploiement, sur son URL publique et pas dans votre dépôt.

RFC 9309, protocole d'exclusion des robots | Google, interprétation de robots.txt

Technique

Codes HTTP, ce que votre serveur répond change tout

Un fichier robots.txt qui renvoie une erreur ne se comporte pas comme un fichier vide, et l'écart entre les deux situations peut arrêter net l'exploration de votre site. La RFC 9309 distingue le fichier indisponible du fichier inaccessible, avec deux conséquences opposées.

Comportements documentés par la RFC 9309 et par la documentation Google, relevés le 14 août 2026.
Réponse du serveurRFC 9309Traitement chez Google
200Le fichier est analysé tel quelRègles appliquées, cache de vingt-quatre heures en général
3xxRedirections suivies dans une limite raisonnableAu moins cinq sauts suivis, au-delà le cas est traité comme un 404
4xx sauf 429Fichier indisponible, le robot peut accéder à toutTraité comme si aucun fichier robots.txt n'existait
429Limitation de débit, pas une absence de règlesTraité à part des autres erreurs client
5xxFichier inaccessible, le robot doit supposer une interdiction complèteArrêt de l'exploration pendant douze heures, puis dernière version en cache pendant trente jours
  • Une erreur 500 sur robots.txt pendant une opération de maintenance suffit à suspendre l'exploration de tout le site.
  • Une page HTML personnalisée renvoyée en 200 à la place du fichier attendu est analysée comme un fichier de règles, avec des résultats imprévisibles.
  • Une redirection vers la page d'accueil est le meilleur moyen de rendre vos règles invisibles.

RFC 9309 | Google, interprétation de robots.txt

Nuance

Crawl-delay, un signal non standard et inégalement suivi

La directive Crawl-delay n'appartient pas à la RFC 9309, elle reste une extension propre à chaque opérateur. Google indique noir sur blanc que son analyseur ne prend en charge que user-agent, allow, disallow et sitemap, et que les autres champs comme crawl-delay ne sont pas pris en charge. Anthropic fait le choix inverse et documente la prise en charge de cette extension non standard pour limiter l'activité d'exploration, avec un exemple qui fixe une seconde entre deux requêtes pour ClaudeBot.

La conséquence pratique est simple. Si votre serveur souffre du volume de requêtes, Crawl-delay ne suffira pas, il faut une limitation de débit côté serveur, une réponse 429 correctement formée, et si besoin une règle de pare-feu ciblée sur les plages d'adresses publiées par l'opérateur concerné.

Google, champs pris en charge | Anthropic, Crawl-delay

Sécurité

Un user-agent se falsifie, comment vérifier un vrai crawler

Une chaîne user-agent est déclarative, n'importe quel script peut annoncer GPTBot ou Googlebot. Toute décision sérieuse de blocage ou d'autorisation doit donc reposer sur l'origine réseau de la requête, pas sur son étiquette. Les grands opérateurs publient exactement pour cela des listes d'adresses IP au format JSON, maintenues de leur côté, que votre pare-feu ou votre CDN peut consommer. Google complète ce dispositif par une vérification en deux temps, une résolution DNS inverse de l'adresse qui doit aboutir à googlebot.com, google.com ou googleusercontent.com, puis une résolution directe de ce nom qui doit redonner l'adresse de départ. Apple documente la même méthode avec le domaine applebot.apple.com. Cette double vérification est la seule manière fiable de distinguer un robot officiel d'un aspirateur qui emprunte son nom, et elle protège aussi vos statistiques de trafic IA contre un bruit important.

Ressources de vérification publiées par les opérateurs, relevées le 14 août 2026.
OpérateurPlages publiéesVérification complémentaire
OpenAIopenai.com/searchbot.json, openai.com/gptbot.json, openai.com/chatgpt-user.json, openai.com/adsbot.jsonMarqueur robots.txt ajouté dans la chaîne user-agent lors de la lecture du fichier
Anthropicclaude.com/crawling/bots.jsonUne adresse présente dans la liste indique un robot Anthropic
Perplexityperplexity.com/perplexitybot.json, perplexity.com/perplexity-user.jsonListes distinctes selon le robot
Googlecommon-crawlers.json, special-crawlers.json, user-triggered-fetchers.json, user-triggered-agents.jsonDNS inverse puis DNS direct sur googlebot.com ou google.com
AppleFichier JSON de préfixes CIDR ApplebotDNS inverse sur applebot.apple.com

Google, vérifier les requêtes des robots | Apple, identification d'Applebot

Infrastructure

Au-delà de robots.txt, WAF, CDN et signaux d'usage

robots.txt exprime une préférence, il ne bloque rien techniquement. Pour un blocage contraignant, la décision se prend au niveau du pare-feu applicatif ou du CDN, sur la base des plages d'adresses vérifiées plutôt que du nom annoncé. C'est aussi à ce niveau que se gèrent les limitations de débit et les réponses 429.

L'écosystème bouge vite de ce côté. Cloudflare a annoncé le 1er juillet 2025 le passage au blocage des robots IA par défaut, sauf rémunération des créateurs, puis a publié le 24 septembre 2025 une Content Signals Policy qui ajoute à robots.txt une ligne de préférences d'usage. Trois signaux existent, search pour la constitution d'un index et l'affichage de résultats, ai-input pour l'alimentation d'un modèle au moment de la réponse, ai-train pour l'entraînement. Cloudflare applique par défaut Content-Signal search=yes, ai-train=no sur les fichiers robots.txt qu'il gère, et laisse volontairement ai-input non renseigné.

En parallèle, l'IETF a chartré en janvier 2026 un groupe de travail AI Preferences chargé de standardiser un vocabulaire de préférences et son rattachement au contenu, avec un mécanisme Content-Usage dans robots.txt et dans les en-têtes HTTP, en mise à jour de la RFC 9309. Ces documents restent à l'état de brouillon à la date de publication de ce guide, donc aucun opérateur n'est tenu de les suivre aujourd'hui.

  • Un signal d'usage exprime une intention juridique, il ne remplace pas un blocage technique.
  • Vérifiez ce que votre CDN écrit à votre place, un robots.txt géré peut contenir des lignes que vous n'avez jamais rédigées.
  • Si vous vendez des licences de contenu, gardez la trace des dates de changement, un blocage rétroactif ne se prouve pas.

Cloudflare, Content Signals Policy | Cloudflare, blocage par défaut | IETF, groupe de travail AI Preferences

Méthode

Comment tester votre configuration sur votre vrai domaine

Le fichier que vous croyez avoir publié et celui que votre serveur renvoie sont deux choses différentes, surtout derrière un CDN, un reverse proxy ou un framework qui génère robots.txt à la volée. Le test ci-dessous a été exécuté le 14 août 2026 sur tryhikoo.com avec notre vérificateur public.

Le résultat mérite une lecture attentive. Certains jetons apparaissent avec la mention non listé et le statut autorisé, ce qui signifie qu'ils ne sont pas nommés dans le fichier et qu'ils héritent du groupe étoile. C'est un comportement normal, mais il devient un piège dès que le groupe étoile contient des interdictions, puisque le jeton non listé les subit alors intégralement.

Résultat du vérificateur de crawlers IA de Hikoo pour tryhikoo.com, avec le statut de chaque robot
Test exécuté le 14 août 2026 dans le vérificateur de crawlers IA de Hikoo, sur le domaine tryhikoo.com. Le fichier robots.txt est trouvé et les seize jetons testés sont autorisés. La mention non listé signale un jeton absent du fichier, qui hérite du groupe étoile. Certains jetons testés par l'outil, comme Gemini-Deep-Research, ne figurent pas dans la documentation publique de leur éditeur, nous ne les intégrons donc pas aux tableaux de référence de ce guide.
  • Ouvrez votre robots.txt dans un navigateur et vérifiez le code de réponse ainsi que le type de contenu renvoyé.
  • Passez le domaine et les sous-domaines dans le vérificateur de crawlers IA pour obtenir le statut jeton par jeton.
  • Rejouez le test après chaque déploiement, un cache CDN pouvant servir une ancienne version pendant plusieurs heures.
  • Contrôlez ensuite le rendu réel d'une page avec le simulateur de crawler IA, car un accès autorisé ne garantit pas un contenu lisible.
  • Terminez par vos journaux serveur, en vérifiant les adresses IP plutôt que les noms annoncés.

Outils gratuits. Vérificateur de crawlers IA | Simulateur de crawler IA | Générateur de llms.txt

Arbitrage

Trois profils de site, trois arbitrages différents

Aucune configuration ne convient à tout le monde, et recommander d'autoriser tous les robots serait aussi paresseux que de tout bloquer. Voici comment nous raisonnons selon le modèle économique du site.

Grille d'arbitrage utilisée par nos équipes, à adapter à votre modèle économique.
ProfilFamille rechercheFamille entraînementRaison
Site B2B ou SaaS qui cherche des clientsTout autoriserAutoriserLa citation dans une réponse vaut plus que la protection d'un contenu marketing destiné à être repris
Éditeur de contenu rémunéré à l'audienceAutoriserBloquer jeton par jetonL'entraînement ne rapporte rien tant qu'il n'existe pas de contrat, la recherche apporte encore des visites
Commerce en ligneAutoriser, fiches produit comprisesArbitrage selon la valeur des descriptifsLes comparaisons générées par les assistants se nourrissent des fiches accessibles
Documentation technique ou base de connaissanceAutoriserAutoriserÊtre la référence citée dans les réponses techniques est un canal d'acquisition durable
  • Aucune configuration robots.txt ne garantit une citation, elle conditionne seulement l'accès.
  • Un contenu accessible mais générique ne sera pas repris, l'accès est une condition nécessaire et jamais suffisante.
  • Si vous bloquez une famille, documentez la décision et sa date, vous en aurez besoin lors d'une négociation.

Mesurer la suite. Analyzer | Spotlight | Audit IA gratuit

Pièges

Sept erreurs fréquentes dans un robots.txt orienté IA

  • Copier une liste de jetons trouvée sur un blog sans vérifier la documentation de l'éditeur, la moitié des listes qui circulent contenant encore des jetons abandonnés.
  • Déclarer un groupe pour un jeton IA et oublier d'y recopier les interdictions du groupe étoile, ce qui ouvre par accident vos zones sensibles.
  • Croire qu'un Disallow protège un contenu, alors qu'il le signale publiquement à qui lit le fichier.
  • Oublier les sous-domaines, chaque hôte ayant son propre fichier.
  • Bloquer la famille entraînement en pensant protéger son trafic, alors que le trafic dépend de la famille recherche.
  • Laisser un CDN réécrire le fichier sans relire le résultat servi en production.
  • Ne jamais revenir sur le fichier, alors que les opérateurs ajoutent de nouveaux jetons plusieurs fois par an.

Définitions utiles. llms.txt | Visibilité IA | Citations IA

Questions fréquentes

Bloquer GPTBot me retire-t-il de ChatGPT ?

Non. GPTBot concerne l'entraînement des modèles de fondation. La recherche dans ChatGPT dépend de OAI-SearchBot, et c'est ce jeton qu'il faut autoriser pour rester affiché dans les réponses de recherche. Les deux réglages sont indépendants.

Faut-il un fichier llms.txt en plus de robots.txt ?

Ce sont deux objets différents. robots.txt exprime des règles d'accès suivies par les robots des grands opérateurs. llms.txt propose un plan de contenu lisible par une machine, sans adoption officielle équivalente, et Google indique de son côté ne pas utiliser llms.txt pour la Recherche.

Comment bloquer un robot qui ignore robots.txt ?

Par le serveur ou le pare-feu applicatif, en filtrant sur les plages d'adresses IP publiées par l'opérateur plutôt que sur la chaîne user-agent. Une règle basée sur le nom annoncé se contourne en une ligne de code.

Crawl-delay fonctionne-t-il sur les crawlers IA ?

Cela dépend de l'opérateur. Google ne prend pas en charge crawl-delay, Anthropic documente au contraire la prise en charge de cette extension non standard pour ClaudeBot. Pour maîtriser la charge de façon fiable, utilisez une limitation de débit et des réponses 429.

Un robots.txt en erreur 500 peut-il faire disparaître mon site ?

Il peut suspendre son exploration. La RFC 9309 demande de supposer une interdiction complète quand le fichier est inaccessible, et Google arrête d'explorer pendant douze heures avant de réutiliser sa dernière version en cache pendant trente jours.

Dois-je répéter mes règles sur chaque sous-domaine ?

Oui. Un fichier robots.txt ne vaut que pour un couple protocole, hôte et port. Anthropic le rappelle explicitement, l'exclusion doit être répétée sur chaque sous-domaine que vous voulez couvrir, y compris les sous-domaines techniques qui servent du contenu public.

Puis-je sortir des aperçus IA de Google en restant dans la Recherche ?

Non, pas avec un jeton dédié. Google indique que l'intelligence artificielle est intégrée à la Recherche et que les directives adressées à Googlebot sont le levier de contrôle. Les balises nosnippet, data-nosnippet et max-snippet limitent l'affichage, mais elles agissent aussi sur les extraits classiques.

À quelle fréquence faut-il relire son robots.txt ?

Au moins deux fois par an, et après chaque migration technique. Les opérateurs ajoutent régulièrement des jetons, OAI-AdsBot et Claude-SearchBot sont apparus après la première vague de robots IA, et une liste écrite en 2024 est déjà incomplète aujourd'hui.

Conclusion

La bonne question n'est pas d'autoriser ou de bloquer l'intelligence artificielle, c'est de décider quel usage vous acceptez, opérateur par opérateur, en connaissant le prix de chaque refus. La famille recherche conditionne votre présence dans les réponses, la famille entraînement relève de votre stratégie éditoriale, et les récupérations déclenchées par un internaute échappent de toute façon à robots.txt.

Commencez par vérifier ce que votre domaine renvoie vraiment, jeton par jeton, puis mesurez ce que cet accès produit réellement en citations. Notre vérificateur de crawlers IA donne le premier résultat en quelques secondes, et l'audit gratuit indique si les assistants citent déjà votre site.

Sources

  1. OpenAI Overview of OpenAI Crawlers. OpenAI Developers, consulté le 14 août 2026
  2. Anthropic Does Anthropic crawl data from the web, and how can site owners block the crawler. Anthropic Support, consulté le 14 août 2026
  3. Perplexity Perplexity Crawlers. Perplexity Documentation, consulté le 14 août 2026
  4. Google Google Crawler (User Agent) Overview. Google Crawling Infrastructure, 2026
  5. Google Google common crawlers. Google Crawling Infrastructure, 2026
  6. Google Google user-triggered fetchers. Google Crawling Infrastructure, 2026
  7. Google Verify requests from Google crawlers and fetchers. Google Crawling Infrastructure, 2026
  8. Google How Google interprets the robots.txt specification. Google Search Central, 2026
  9. Google AI features and your website. Google Search Central, 2026
  10. Apple About Applebot. Apple Support, consulté le 14 août 2026
  11. Meta Web crawlers. Meta for Developers, consulté le 14 août 2026
  12. Microsoft Announcing new options for webmasters to control usage of their content in Bing Chat. Bing Webmaster Blog, septembre 2023
  13. Koster M., Illyes G., Zeller H., Sassman L. RFC 9309, Robots Exclusion Protocol. IETF, septembre 2022
  14. Cloudflare Giving users choice with Cloudflare Content Signals Policy. Cloudflare Blog, 24 septembre 2025
  15. Cloudflare Content Independence Day, no AI crawl without compensation. Cloudflare Blog, 1er juillet 2025
  16. IETF AI Preferences (aipref) working group. IETF Datatracker, 2026
À propos de l'auteur
Timothé Merle
Co-founder Hikoo - Expert AEO/GEO
Voir le profil LinkedIn

Pour aller plus loin

Articles similaires

Réservez une démo personnalisée

Découvrez comment Hikoo peut booster votre visibilité sur les moteurs de recherche IA.