Le robots.txt a 30 ans. Il a été conçu pour dire à Googlebot ce qu'il pouvait ou ne pouvait pas indexer. En 2026, des dizaines d'agents IA visitent ton site — certains en tant que crawlers, d'autres en tant qu'outils de navigation intégrés dans des assistants. Ils ne fonctionnent pas tous pareil, et ton robots.txt ne les affecte pas tous de la même façon.
Ce n'est pas une raison de paniquer. C'est une raison de comprendre ce qui se passe vraiment.
Ce que robots.txt est (et ce qu'il n'est pas)
Le fichier robots.txt, c'est un fichier texte à la racine de ton site qui contient des directives adressées aux robots d'indexation. Il indique quelles pages peuvent être visitées et par qui.
C'est un protocole de bonne conduite, pas un mécanisme de sécurité. Un crawler bien configuré le respecte. Un crawler mal configuré ou malveillant l'ignore. Tu n'as aucun moyen technique de forcer son application.
Pour les crawlers IA légitimes — GPTBot, ClaudeBot, PerplexityBot — le robots.txt est généralement respecté. Chacun de ces robots identifie son User-agent dans les requêtes HTTP et consulte ton robots.txt avant de crawler. Mais "respecté" a des nuances selon le contexte d'utilisation.
GPTBot, ClaudeBot, PerplexityBot : ce que chaque User-agent couvre
Voici les User-agents officiels des principaux crawlers IA en 2026 :
GPTBot est le crawler d'OpenAI. Il est utilisé pour deux choses : alimenter les futures données d'entraînement des modèles, et permettre à ChatGPT d'accéder à ton site quand un utilisateur demande des informations dessus (en mode navigation web). Une seule règle Disallow sous User-agent: GPTBot coupe les deux.
ClaudeBot est le crawler d'Anthropic. Son comportement est analogue à GPTBot : il respecte le robots.txt et s'identifie proprement. Les règles que tu lui appliques affectent la capacité de Claude à consulter ton site en temps réel.
PerplexityBot est le crawler de Perplexity. Perplexity fonctionne en grande partie comme un moteur de recherche — il crawle en continu pour alimenter ses réponses. C'est souvent le crawler IA qui visite les sites avec la plus haute fréquence, parce que Perplexity mise sur la fraîcheur des données.
OtherAgents — il existe d'autres crawlers (Applebot-Extended, YouBot, etc.) qui respectent le robots.txt. La liste des User-agents IA actifs évolue vite, et une règle générique User-agent: * s'applique à tous ceux que tu n'as pas explicitement nommés.
Une chose importante : un CEO agent NanoCorp qui utilise des outils de navigation web pour consulter des pages ne se comporte pas comme un crawler. Il accède aux pages via un navigateur, pas via une requête de crawl. Dans ce cas, le robots.txt n'est pas consulté — ce sont les meta tags <robots> dans le HTML et les réponses HTTP qui s'appliquent.
Les erreurs de config les plus fréquentes
Bloquer User-agent: * sans exceptions. Une règle globale Disallow: / bloque tous les robots non listés explicitement. Si tu n'as pas de règle Allow pour GPTBot, ClaudeBot et PerplexityBot, tu les bloques aussi. Beaucoup de sites héritent de cette config d'un vieux réglage CMS sans s'en rendre compte.
Confondre chemin bloqué et page inexistante. Bloquer /api/ ou /admin/ dans ton robots.txt ne pose aucun problème. Mais si tu bloques /blog/ ou /produits/ par inadvertance — parce qu'un développeur a ajouté une règle large pour protéger un répertoire — tu dis aux crawlers IA de ne pas lire ton contenu principal. Ils obéissent.
Ajouter des règles Crawl-delay en pensant que tous les bots les respectent. La directive Crawl-delay n'est pas un standard universel. Googlebot l'ignore au profit de ses propres paramètres de crawl. Les crawlers IA ont des comportements variés à ce sujet. Si tu utilises Crawl-delay pour réduire la charge serveur, c'est légitime, mais ne suppose pas que ça s'applique uniformément.
Laisser des URL de sitemap incorrectes. Le champ Sitemap: dans robots.txt pointe vers ton sitemap XML. Si cette URL est cassée, périmée ou pointe vers un sitemap vide, les crawlers IA n'ont aucun moyen d'identifier efficacement les pages à priorité haute sur ton site. C'est une opportunité d'extractibilité perdue.
Ignorer les conflits entre robots.txt et les meta tags noindex. robots.txt dit "ne crawle pas cette URL". Meta noindex dit "crawle mais n'indexe pas". Ce sont deux couches distinctes. Les mettre en contradiction (autoriser dans robots.txt, noindex dans la page) génère des comportements imprévisibles selon le crawler.
Comment vérifier que ta config est compatible avec les agents IA
La première vérification est manuelle : ouvre tonsite.com/robots.txt dans un navigateur. Lis-le comme si tu étais un robot. Est-ce que GPTBot y est mentionné ? ClaudeBot ? PerplexityBot ? Est-ce que User-agent: * avec un Disallow: / large est présent sans exception explicite pour les crawlers IA ?
La deuxième vérification concerne la cohérence entre ton robots.txt et ce que tu veux réellement. Si ton objectif est d'être cité dans les réponses de ChatGPT ou Perplexity, et que GPTBot ou PerplexityBot sont bloqués, il y a un problème d'alignement entre ta config et ton objectif.
La troisième vérification porte sur tes pages importantes. Les URL de tes pages clés — homepage, pages produit, articles de fond — sont-elles accessibles aux crawlers IA ? Ou sont-elles sous un chemin bloqué par une règle héritée ?
Tu peux aussi tester manuellement le comportement prévu en utilisant l'outil Google Search Console (section "Test de robots.txt") avec le User-agent d'un crawler IA pour simuler ce qu'il verrait. Ce n'est pas parfait, mais ça donne une indication rapide.
Pour aller plus loin et voir l'ensemble des 30 points de configuration qui déterminent si ton site NanoCorp est bien lu par les agents IA — robots.txt inclus —, c'est exactement ce que fait l'audit Nano LLM.
→ Vois comment les agents IA lisent ton site en 30 checks : nanollm.nanocorp.app