Les crawlers IA ne forment pas un bloc. OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot et bingbot alimentent des réponses qui citent votre site, les bloquer vous fait disparaître de ces réponses. GPTBot, Google-Extended, Applebot-Extended, ClaudeBot et Meta-ExternalAgent servent surtout l'entraînement, les bloquer est un arbitrage éditorial sans effet direct sur votre visibilité. ChatGPT-User, Perplexity-User et Meta-ExternalFetcher agissent à la demande d'un internaute et ne suivent pas toujours robots.txt. Enfin, robots.txt reste une préférence publique appliquée volontairement, un user-agent se falsifie, donc tout blocage réellement contraignant passe par une vérification d'adresse IP au niveau du serveur ou du pare-feu applicatif.
Quels crawlers IA faut-il autoriser dans robots.txt ?
Autorisez les crawlers qui alimentent des réponses citant votre site, arbitrez ceux qui servent l'entraînement. Concrètement, laissez passer OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot et bingbot si vous cherchez de la visibilité. Décidez ensuite, contenu par contenu, pour GPTBot, ClaudeBot, Google-Extended, Applebot-Extended et Meta-ExternalAgent.
Cette séparation est écrite dans les documentations officielles, et elle vaut d'un fournisseur à l'autre. OpenAI la formule ainsi sur sa page dédiée aux robots, chaque réglage est indépendant des autres, un site peut autoriser OAI-SearchBot pour apparaître dans les résultats de recherche tout en interdisant GPTBot afin de signaler que le contenu exploré ne doit pas servir à entraîner ses modèles de fondation. Google décrit le même découplage dans l'autre sens, puisque Google-Extended pilote l'usage de votre contenu pour l'entraînement de Gemini sans toucher à votre présence dans la Recherche. Le raisonnement utile n'est donc jamais d'autoriser ou de bloquer l'IA, mais de savoir quel usage vous acceptez, pour quel opérateur, et à quel prix pour votre visibilité.
Une précision compte avant d'écrire la moindre ligne. Un blocage n'efface pas le passé, un contenu déjà exploré et déjà absorbé par un modèle reste dans ce modèle. Le fichier robots.txt exprime une préférence pour les visites à venir, rien de plus.
- Objectif visibilité, autorisez toute la famille recherche et laissez passer les récupérations demandées par un internaute.
- Objectif protection éditoriale, bloquez la famille entraînement jeton par jeton, en gardant la famille recherche ouverte.
- Contenu confidentiel, ne comptez jamais sur robots.txt, un fichier public qui affiche justement les chemins que vous voulez cacher. Utilisez une authentification.
- Dans tous les cas, vérifiez le résultat réel sur votre domaine plutôt que de faire confiance au fichier que vous croyez avoir publié.
OpenAI, vue d'ensemble des robots | Google, crawlers courants
Testez votre fichier. Vérificateur d'accès des crawlers IA | Simulateur de crawler IA
Recherche, entraînement, requête utilisateur et agent
Quatre familles de robots se partagent aujourd'hui le trafic dit IA, et confondre ces familles produit la majorité des mauvaises décisions que nous voyons en audit. Une même entreprise opère souvent un jeton par famille, avec des règles de respect de robots.txt différentes pour chacun.
La famille agent est la plus récente. Google publie désormais un fichier d'adresses IP dédié aux agents déclenchés par un utilisateur, à côté de celui des explorateurs classiques, et Meta décrit un robot qui aide son IA à naviguer sur des sites pour accomplir une tâche. Ces clients ressemblent à un internaute plus qu'à un moteur, ce qui rend le blocage par robots.txt inopérant et le blocage par pare-feu risqué.
| Famille | Jetons typiques | robots.txt | Ce que vous jouez |
|---|---|---|---|
| Recherche et citation | OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot, bingbot | Respecté | Votre présence dans les réponses générées et dans les liens qui les accompagnent |
| Entraînement | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent | Respecté | L'usage de votre contenu comme donnée d'apprentissage, sans effet direct sur la visibilité |
| Requête lancée par un internaute | ChatGPT-User, Claude-User, Perplexity-User, Meta-ExternalFetcher | Partiellement, souvent ignoré | La lecture d'une page qu'un utilisateur a explicitement demandée |
| Agent | Google-Agent, Meta-ExternalFetcher, Google-CloudVertexBot | Généralement ignoré | L'exécution d'une tâche pour un utilisateur, formulaire et parcours inclus |
Google, récupérateurs déclenchés par un utilisateur | Meta, robots d'exploration
Pour aller plus loin. Préparer votre site pour les agents IA
Les jetons OpenAI, Anthropic et Perplexity, vérifiés un par un
Le tableau ci-dessous reprend les jetons exacts tels qu'ils apparaissent dans la documentation de leur propriétaire, avec la conséquence réelle d'un blocage. Les recommandations sont indicatives, elles supposent un site qui cherche de la visibilité commerciale.
| Jeton | Propriétaire | Finalité | robots.txt | Si vous bloquez | Recommandation |
|---|---|---|---|---|---|
| OAI-SearchBot | OpenAI | Recherche dans ChatGPT | Respecté | Le site n'apparaît plus dans les réponses de recherche ChatGPT, il peut rester un lien de navigation | Autoriser |
| GPTBot | OpenAI | Entraînement des modèles de fondation | Respecté | Le contenu n'est plus utilisé pour l'entraînement, aucune perte de visibilité immédiate | Arbitrage éditorial |
| ChatGPT-User | OpenAI | Visite déclenchée par la question d'un utilisateur | Peut ne pas s'appliquer | La page qu'un utilisateur a demandée ne peut pas être lue | Laisser passer |
| OAI-AdsBot | OpenAI | Contrôle des pages soumises comme publicités | Respecté | Vos pages publicitaires ne peuvent pas être validées | Autoriser si vous achetez de la publicité |
| ClaudeBot | Anthropic | Collecte pour les jeux de données d'entraînement | Respecté, Crawl-delay accepté | Le contenu n'alimente plus l'entraînement | Arbitrage éditorial |
| Claude-SearchBot | Anthropic | Qualité des résultats de recherche | Respecté | Moins de chances que vos pages soient retenues comme source | Autoriser |
| Claude-User | Anthropic | Accès à une page pendant une conversation | Respecté | La page demandée par l'utilisateur n'est pas lue | Laisser passer |
| PerplexityBot | Perplexity | Indexation pour afficher et lier des sites dans les résultats | Respecté | Le site sort de l'index qui alimente les réponses | Autoriser |
| Perplexity-User | Perplexity | Visite déclenchée par la question d'un utilisateur | Généralement ignoré | Un blocage ne peut passer que par le serveur ou le pare-feu | Laisser passer |

OpenAI, robots et user-agents | Anthropic, exploration du web | Perplexity, robots
Les jetons Google, Apple, Meta et Microsoft
Chez Google, la nuance est structurante. Les aperçus IA et le mode IA sont servis à partir de la Recherche, et la documentation indique que l'intelligence artificielle est intégrée à la Recherche, ce qui fait des directives robots.txt adressées à Googlebot le levier de contrôle des propriétaires de site. Autrement dit, aucun jeton ne vous retire des surfaces IA de Google en vous laissant dans les liens bleus. Google-Extended, lui, ne touche ni votre présence dans la Recherche ni votre classement, il décide seulement si votre contenu peut entraîner Gemini et servir d'ancrage dans les applications Gemini. Apple et Microsoft raisonnent différemment, avec un contrôle à deux étages. Chez Apple, Applebot explore pour Spotlight, Siri et Safari, tandis qu'Applebot-Extended sert uniquement à refuser l'entraînement. Chez Microsoft, ce sont les balises NOCACHE et NOARCHIVE qui limitent l'usage conversationnel du contenu, sans le sortir de l'index Bing.
| Jeton | Propriétaire | Finalité | robots.txt | Si vous bloquez | Recommandation |
|---|---|---|---|---|---|
| Googlebot | Recherche, Discover, aperçus IA et mode IA, servis depuis la Recherche | Respecté | Disparition de Google Search et donc des surfaces IA associées | Autoriser | |
| Google-Extended | Usage du contenu pour entraîner Gemini et pour l'ancrage dans les applications Gemini | Respecté | Aucun effet sur la Recherche ni sur le classement, seul l'usage Gemini est retiré | Arbitrage éditorial | |
| Google-CloudVertexBot | Construction des agents Vertex AI | Respecté | Vos pages ne nourrissent plus les agents construits par vos clients ou partenaires | Selon vos cas clients | |
| Google-Agent | Agents exécutant une tâche demandée par un utilisateur | Généralement ignoré | Un blocage doit se faire au niveau du serveur | Laisser passer | |
| Applebot | Apple | Recherche intégrée à Spotlight, Siri et Safari | Respecté | Sortie des résultats de recherche de l'écosystème Apple | Autoriser |
| Applebot-Extended | Apple | Jeton de refus pour l'entraînement des modèles de fondation Apple | Respecté | Le contenu reste exploré par Applebot mais sort de l'entraînement | Arbitrage éditorial |
| Meta-ExternalAgent | Meta | Entraînement de modèles et indexation de contenu | Respecté | Exclusion des jeux de données Meta | Arbitrage éditorial |
| Meta-ExternalFetcher | Meta | Récupération d'un lien à la demande d'un utilisateur, usages agentiques compris | Peut être contourné | Blocage fiable uniquement côté serveur | Laisser passer |
| bingbot | Microsoft | Index Bing, qui alimente aussi Copilot | Respecté | Sortie de Bing et des réponses Copilot associées | Autoriser |
- Microsoft ne passe pas seulement par robots.txt. Les balises NOCACHE et NOARCHIVE décrites sur le blog Bing Webmaster limitent l'usage du contenu dans les réponses conversationnelles tout en gardant le site dans les résultats de recherche.
- Apple applique la même logique à deux étages. Applebot-Extended retire votre contenu de l'entraînement, et la balise nosnippet le retire des réponses de connaissance générale, sans vous sortir de Spotlight, Siri et Safari.
- Un jeton absent de la documentation d'un éditeur circule parfois dans des listes toutes faites. Nous ne le reprenons pas ici tant qu'une source officielle ne le confirme pas.
Google, fonctionnalités IA et votre site | Apple, à propos d'Applebot | Bing Webmaster Blog, contrôles de contenu
Que se passe-t-il vraiment quand vous bloquez un crawler ?
Le blocage produit trois effets très différents selon la famille visée, et c'est la seule grille qui évite les décisions regrettées six mois plus tard. Bloquer un robot de recherche vous retire des réponses où vous auriez pu être cité, immédiatement et de façon visible, OpenAI précise même que ses systèmes mettent environ vingt-quatre heures à intégrer un changement de robots.txt. Bloquer un robot d'entraînement ne change rien à votre visibilité du jour au lendemain, c'est un arbitrage sur l'usage futur de votre contenu, et il n'annule pas les apprentissages déjà réalisés. Bloquer un récupérateur déclenché par un internaute revient à casser une demande explicite, quelqu'un a collé votre lien dans une conversation et attend une réponse pendant que votre serveur renvoie une erreur. Ce troisième cas est le plus coûteux et le plus rarement anticipé.
Un quatrième effet est souvent oublié, celui du signal donné aux autres. Un fichier robots.txt est public, il est lu, archivé et comparé. Fermer massivement une famille alors que vos concurrents restent ouverts revient à leur céder la place de source citée, sans compensation tant que vous n'avez pas de contrat de licence.
- Bloquer GPTBot ne vous retire pas de la recherche ChatGPT, c'est OAI-SearchBot qui gouverne cette surface.
- Bloquer Google-Extended ne vous retire ni des aperçus IA ni du mode IA, qui dépendent de Googlebot et de la Recherche.
- Bloquer Googlebot vous retire de la Recherche et donc, mécaniquement, des surfaces IA de Google.
- Bloquer un robot d'entraînement n'efface pas ce qui a déjà été appris de votre contenu.
- Un blocage mal écrit peut annuler d'autres règles, un robot n'appliquant que le groupe le plus spécifique qui le concerne.
Guides liés. Apparaître dans AI Overviews | Être cité par Perplexity
La syntaxe qui compte vraiment dans robots.txt
Le protocole d'exclusion des robots est normalisé depuis septembre 2022 par la RFC 9309, un document sur la voie des standards, ce qui met fin à vingt-cinq ans de conventions informelles. La norme couvre les lignes user-agent, les règles allow et disallow, et les caractères spéciaux de correspondance de chemin. Elle demande aussi une limite d'analyse d'au moins 500 kibioctets et un cache qui ne dépasse pas vingt-quatre heures.
Trois règles expliquent la quasi-totalité des fichiers cassés que nous rencontrons. Un robot n'applique qu'un seul groupe, le plus spécifique qui le nomme, donc déclarer un groupe pour GPTBot annule pour lui les règles du groupe étoile. Le fichier vaut pour un couple protocole, hôte et port précis, donc chaque sous-domaine a besoin de son propre fichier, et Anthropic le rappelle explicitement pour chaque sous-domaine que vous voulez exclure. Enfin robots.txt régit l'exploration, pas l'indexation ni l'affichage, ces deux points se pilotant avec les balises meta robots.

- Placez le fichier à la racine du domaine, en clair, servi en text/plain.
- Écrivez un groupe étoile qui porte vos règles générales et votre ligne Sitemap.
- Ajoutez un groupe par jeton seulement quand vous voulez un traitement différent, et recopiez-y les règles générales dont ce jeton a besoin.
- Répétez l'opération sur chaque sous-domaine, y compris les sous-domaines techniques qui servent du contenu public.
- Relisez le fichier après déploiement, sur son URL publique et pas dans votre dépôt.
RFC 9309, protocole d'exclusion des robots | Google, interprétation de robots.txt
Codes HTTP, ce que votre serveur répond change tout
Un fichier robots.txt qui renvoie une erreur ne se comporte pas comme un fichier vide, et l'écart entre les deux situations peut arrêter net l'exploration de votre site. La RFC 9309 distingue le fichier indisponible du fichier inaccessible, avec deux conséquences opposées.
| Réponse du serveur | RFC 9309 | Traitement chez Google |
|---|---|---|
| 200 | Le fichier est analysé tel quel | Règles appliquées, cache de vingt-quatre heures en général |
| 3xx | Redirections suivies dans une limite raisonnable | Au moins cinq sauts suivis, au-delà le cas est traité comme un 404 |
| 4xx sauf 429 | Fichier indisponible, le robot peut accéder à tout | Traité comme si aucun fichier robots.txt n'existait |
| 429 | Limitation de débit, pas une absence de règles | Traité à part des autres erreurs client |
| 5xx | Fichier inaccessible, le robot doit supposer une interdiction complète | Arrêt de l'exploration pendant douze heures, puis dernière version en cache pendant trente jours |
- Une erreur 500 sur robots.txt pendant une opération de maintenance suffit à suspendre l'exploration de tout le site.
- Une page HTML personnalisée renvoyée en 200 à la place du fichier attendu est analysée comme un fichier de règles, avec des résultats imprévisibles.
- Une redirection vers la page d'accueil est le meilleur moyen de rendre vos règles invisibles.
Crawl-delay, un signal non standard et inégalement suivi
La directive Crawl-delay n'appartient pas à la RFC 9309, elle reste une extension propre à chaque opérateur. Google indique noir sur blanc que son analyseur ne prend en charge que user-agent, allow, disallow et sitemap, et que les autres champs comme crawl-delay ne sont pas pris en charge. Anthropic fait le choix inverse et documente la prise en charge de cette extension non standard pour limiter l'activité d'exploration, avec un exemple qui fixe une seconde entre deux requêtes pour ClaudeBot.
La conséquence pratique est simple. Si votre serveur souffre du volume de requêtes, Crawl-delay ne suffira pas, il faut une limitation de débit côté serveur, une réponse 429 correctement formée, et si besoin une règle de pare-feu ciblée sur les plages d'adresses publiées par l'opérateur concerné.
Un user-agent se falsifie, comment vérifier un vrai crawler
Une chaîne user-agent est déclarative, n'importe quel script peut annoncer GPTBot ou Googlebot. Toute décision sérieuse de blocage ou d'autorisation doit donc reposer sur l'origine réseau de la requête, pas sur son étiquette. Les grands opérateurs publient exactement pour cela des listes d'adresses IP au format JSON, maintenues de leur côté, que votre pare-feu ou votre CDN peut consommer. Google complète ce dispositif par une vérification en deux temps, une résolution DNS inverse de l'adresse qui doit aboutir à googlebot.com, google.com ou googleusercontent.com, puis une résolution directe de ce nom qui doit redonner l'adresse de départ. Apple documente la même méthode avec le domaine applebot.apple.com. Cette double vérification est la seule manière fiable de distinguer un robot officiel d'un aspirateur qui emprunte son nom, et elle protège aussi vos statistiques de trafic IA contre un bruit important.
| Opérateur | Plages publiées | Vérification complémentaire |
|---|---|---|
| OpenAI | openai.com/searchbot.json, openai.com/gptbot.json, openai.com/chatgpt-user.json, openai.com/adsbot.json | Marqueur robots.txt ajouté dans la chaîne user-agent lors de la lecture du fichier |
| Anthropic | claude.com/crawling/bots.json | Une adresse présente dans la liste indique un robot Anthropic |
| Perplexity | perplexity.com/perplexitybot.json, perplexity.com/perplexity-user.json | Listes distinctes selon le robot |
| common-crawlers.json, special-crawlers.json, user-triggered-fetchers.json, user-triggered-agents.json | DNS inverse puis DNS direct sur googlebot.com ou google.com | |
| Apple | Fichier JSON de préfixes CIDR Applebot | DNS inverse sur applebot.apple.com |
Google, vérifier les requêtes des robots | Apple, identification d'Applebot
Au-delà de robots.txt, WAF, CDN et signaux d'usage
robots.txt exprime une préférence, il ne bloque rien techniquement. Pour un blocage contraignant, la décision se prend au niveau du pare-feu applicatif ou du CDN, sur la base des plages d'adresses vérifiées plutôt que du nom annoncé. C'est aussi à ce niveau que se gèrent les limitations de débit et les réponses 429.
L'écosystème bouge vite de ce côté. Cloudflare a annoncé le 1er juillet 2025 le passage au blocage des robots IA par défaut, sauf rémunération des créateurs, puis a publié le 24 septembre 2025 une Content Signals Policy qui ajoute à robots.txt une ligne de préférences d'usage. Trois signaux existent, search pour la constitution d'un index et l'affichage de résultats, ai-input pour l'alimentation d'un modèle au moment de la réponse, ai-train pour l'entraînement. Cloudflare applique par défaut Content-Signal search=yes, ai-train=no sur les fichiers robots.txt qu'il gère, et laisse volontairement ai-input non renseigné.
En parallèle, l'IETF a chartré en janvier 2026 un groupe de travail AI Preferences chargé de standardiser un vocabulaire de préférences et son rattachement au contenu, avec un mécanisme Content-Usage dans robots.txt et dans les en-têtes HTTP, en mise à jour de la RFC 9309. Ces documents restent à l'état de brouillon à la date de publication de ce guide, donc aucun opérateur n'est tenu de les suivre aujourd'hui.
- Un signal d'usage exprime une intention juridique, il ne remplace pas un blocage technique.
- Vérifiez ce que votre CDN écrit à votre place, un robots.txt géré peut contenir des lignes que vous n'avez jamais rédigées.
- Si vous vendez des licences de contenu, gardez la trace des dates de changement, un blocage rétroactif ne se prouve pas.
Cloudflare, Content Signals Policy | Cloudflare, blocage par défaut | IETF, groupe de travail AI Preferences
Comment tester votre configuration sur votre vrai domaine
Le fichier que vous croyez avoir publié et celui que votre serveur renvoie sont deux choses différentes, surtout derrière un CDN, un reverse proxy ou un framework qui génère robots.txt à la volée. Le test ci-dessous a été exécuté le 14 août 2026 sur tryhikoo.com avec notre vérificateur public.
Le résultat mérite une lecture attentive. Certains jetons apparaissent avec la mention non listé et le statut autorisé, ce qui signifie qu'ils ne sont pas nommés dans le fichier et qu'ils héritent du groupe étoile. C'est un comportement normal, mais il devient un piège dès que le groupe étoile contient des interdictions, puisque le jeton non listé les subit alors intégralement.

- Ouvrez votre robots.txt dans un navigateur et vérifiez le code de réponse ainsi que le type de contenu renvoyé.
- Passez le domaine et les sous-domaines dans le vérificateur de crawlers IA pour obtenir le statut jeton par jeton.
- Rejouez le test après chaque déploiement, un cache CDN pouvant servir une ancienne version pendant plusieurs heures.
- Contrôlez ensuite le rendu réel d'une page avec le simulateur de crawler IA, car un accès autorisé ne garantit pas un contenu lisible.
- Terminez par vos journaux serveur, en vérifiant les adresses IP plutôt que les noms annoncés.
Outils gratuits. Vérificateur de crawlers IA | Simulateur de crawler IA | Générateur de llms.txt
Trois profils de site, trois arbitrages différents
Aucune configuration ne convient à tout le monde, et recommander d'autoriser tous les robots serait aussi paresseux que de tout bloquer. Voici comment nous raisonnons selon le modèle économique du site.
| Profil | Famille recherche | Famille entraînement | Raison |
|---|---|---|---|
| Site B2B ou SaaS qui cherche des clients | Tout autoriser | Autoriser | La citation dans une réponse vaut plus que la protection d'un contenu marketing destiné à être repris |
| Éditeur de contenu rémunéré à l'audience | Autoriser | Bloquer jeton par jeton | L'entraînement ne rapporte rien tant qu'il n'existe pas de contrat, la recherche apporte encore des visites |
| Commerce en ligne | Autoriser, fiches produit comprises | Arbitrage selon la valeur des descriptifs | Les comparaisons générées par les assistants se nourrissent des fiches accessibles |
| Documentation technique ou base de connaissance | Autoriser | Autoriser | Être la référence citée dans les réponses techniques est un canal d'acquisition durable |
- Aucune configuration robots.txt ne garantit une citation, elle conditionne seulement l'accès.
- Un contenu accessible mais générique ne sera pas repris, l'accès est une condition nécessaire et jamais suffisante.
- Si vous bloquez une famille, documentez la décision et sa date, vous en aurez besoin lors d'une négociation.
Mesurer la suite. Analyzer | Spotlight | Audit IA gratuit
Sept erreurs fréquentes dans un robots.txt orienté IA
- Copier une liste de jetons trouvée sur un blog sans vérifier la documentation de l'éditeur, la moitié des listes qui circulent contenant encore des jetons abandonnés.
- Déclarer un groupe pour un jeton IA et oublier d'y recopier les interdictions du groupe étoile, ce qui ouvre par accident vos zones sensibles.
- Croire qu'un Disallow protège un contenu, alors qu'il le signale publiquement à qui lit le fichier.
- Oublier les sous-domaines, chaque hôte ayant son propre fichier.
- Bloquer la famille entraînement en pensant protéger son trafic, alors que le trafic dépend de la famille recherche.
- Laisser un CDN réécrire le fichier sans relire le résultat servi en production.
- Ne jamais revenir sur le fichier, alors que les opérateurs ajoutent de nouveaux jetons plusieurs fois par an.
Définitions utiles. llms.txt | Visibilité IA | Citations IA
Questions fréquentes
Bloquer GPTBot me retire-t-il de ChatGPT ?
Non. GPTBot concerne l'entraînement des modèles de fondation. La recherche dans ChatGPT dépend de OAI-SearchBot, et c'est ce jeton qu'il faut autoriser pour rester affiché dans les réponses de recherche. Les deux réglages sont indépendants.
Faut-il un fichier llms.txt en plus de robots.txt ?
Ce sont deux objets différents. robots.txt exprime des règles d'accès suivies par les robots des grands opérateurs. llms.txt propose un plan de contenu lisible par une machine, sans adoption officielle équivalente, et Google indique de son côté ne pas utiliser llms.txt pour la Recherche.
Comment bloquer un robot qui ignore robots.txt ?
Par le serveur ou le pare-feu applicatif, en filtrant sur les plages d'adresses IP publiées par l'opérateur plutôt que sur la chaîne user-agent. Une règle basée sur le nom annoncé se contourne en une ligne de code.
Crawl-delay fonctionne-t-il sur les crawlers IA ?
Cela dépend de l'opérateur. Google ne prend pas en charge crawl-delay, Anthropic documente au contraire la prise en charge de cette extension non standard pour ClaudeBot. Pour maîtriser la charge de façon fiable, utilisez une limitation de débit et des réponses 429.
Un robots.txt en erreur 500 peut-il faire disparaître mon site ?
Il peut suspendre son exploration. La RFC 9309 demande de supposer une interdiction complète quand le fichier est inaccessible, et Google arrête d'explorer pendant douze heures avant de réutiliser sa dernière version en cache pendant trente jours.
Dois-je répéter mes règles sur chaque sous-domaine ?
Oui. Un fichier robots.txt ne vaut que pour un couple protocole, hôte et port. Anthropic le rappelle explicitement, l'exclusion doit être répétée sur chaque sous-domaine que vous voulez couvrir, y compris les sous-domaines techniques qui servent du contenu public.
Puis-je sortir des aperçus IA de Google en restant dans la Recherche ?
Non, pas avec un jeton dédié. Google indique que l'intelligence artificielle est intégrée à la Recherche et que les directives adressées à Googlebot sont le levier de contrôle. Les balises nosnippet, data-nosnippet et max-snippet limitent l'affichage, mais elles agissent aussi sur les extraits classiques.
À quelle fréquence faut-il relire son robots.txt ?
Au moins deux fois par an, et après chaque migration technique. Les opérateurs ajoutent régulièrement des jetons, OAI-AdsBot et Claude-SearchBot sont apparus après la première vague de robots IA, et une liste écrite en 2024 est déjà incomplète aujourd'hui.
Conclusion
La bonne question n'est pas d'autoriser ou de bloquer l'intelligence artificielle, c'est de décider quel usage vous acceptez, opérateur par opérateur, en connaissant le prix de chaque refus. La famille recherche conditionne votre présence dans les réponses, la famille entraînement relève de votre stratégie éditoriale, et les récupérations déclenchées par un internaute échappent de toute façon à robots.txt.
Commencez par vérifier ce que votre domaine renvoie vraiment, jeton par jeton, puis mesurez ce que cet accès produit réellement en citations. Notre vérificateur de crawlers IA donne le premier résultat en quelques secondes, et l'audit gratuit indique si les assistants citent déjà votre site.
Sources
- OpenAI Overview of OpenAI Crawlers. OpenAI Developers, consulté le 14 août 2026
- Anthropic Does Anthropic crawl data from the web, and how can site owners block the crawler. Anthropic Support, consulté le 14 août 2026
- Perplexity Perplexity Crawlers. Perplexity Documentation, consulté le 14 août 2026
- Google Google Crawler (User Agent) Overview. Google Crawling Infrastructure, 2026
- Google Google common crawlers. Google Crawling Infrastructure, 2026
- Google Google user-triggered fetchers. Google Crawling Infrastructure, 2026
- Google Verify requests from Google crawlers and fetchers. Google Crawling Infrastructure, 2026
- Google How Google interprets the robots.txt specification. Google Search Central, 2026
- Google AI features and your website. Google Search Central, 2026
- Apple About Applebot. Apple Support, consulté le 14 août 2026
- Meta Web crawlers. Meta for Developers, consulté le 14 août 2026
- Microsoft Announcing new options for webmasters to control usage of their content in Bing Chat. Bing Webmaster Blog, septembre 2023
- Koster M., Illyes G., Zeller H., Sassman L. RFC 9309, Robots Exclusion Protocol. IETF, septembre 2022
- Cloudflare Giving users choice with Cloudflare Content Signals Policy. Cloudflare Blog, 24 septembre 2025
- Cloudflare Content Independence Day, no AI crawl without compensation. Cloudflare Blog, 1er juillet 2025
- IETF AI Preferences (aipref) working group. IETF Datatracker, 2026