llms.txt n'est lu par aucun moteur : 97 % des fichiers publiés ne reçoivent jamais une requête d'IA. Votre robots.txt ne vous protège pas davantage : 82 % des sites qui bloquent le robot de recherche de ChatGPT sont cités quand même. Ces deux fichiers déclarent une intention, ils n'appliquent rien.
Le dossier llms.txt est clos
Le fichier llms.txt a été proposé en 2024 comme une carte du site destinée aux modèles de langage. L'idée tenait debout. Les chiffres ont tranché.
Ahrefs a analysé 137 000 domaines : 97 % des fichiers llms.txt publiés n'ont jamais reçu une seule requête d'un robot d'IA. Une autre étude, sur 300 000 domaines, ne trouve aucune corrélation entre la présence du fichier et la fréquence de citation par ChatGPT. Un relevé portant sur plus de 500 millions d'événements de robots IA en 90 jours compte quelques centaines de requêtes visant /llms.txt. GPTBot, ClaudeBot et PerplexityBot lisent le HTML.
Google a clos le débat le 15 mai 2026, dans une documentation consacrée à l'optimisation pour ses fonctionnalités d'IA générative. Aucun traitement préférentiel, aucune voie d'indexation dédiée, le fichier est traité comme n'importe quel fichier texte. Et la position officielle tient en une phrase : optimiser pour la recherche générative, c'est encore du SEO. Ce qui recoupe ce que nous documentons dans notre guide du Generative Engine Optimization.
L'adoption, elle, grimpe. 8,8 fois plus de fichiers publiés en douze mois. Des milliers d'entreprises créent chaque mois un document que rien ne lit.
Nous en avons un. watizi.com/llms.txt existe, et nous le gardons pour une raison précise : Chrome Lighthouse l'audite comme critère dans son rapport destiné aux agents. Le même Google qui répète que le fichier ne sert à rien l'inscrit dans son propre outil de mesure. Tant que cette contradiction dure, le fichier coûte trois kilo-octets et évite un point rouge dans un audit. Ce n'est pas un levier de visibilité. C'est de la conformité cosmétique, et il faut l'appeler comme ça.
Trois usages, trois robots, trois décisions
Pendant que le marché débattait de llms.txt, robots.txt a changé de nature.
Jusqu'en 2025, autoriser ou refuser une IA était une décision unique. Vous laissiez passer, ou vous fermiez la porte. Depuis février 2026, OpenAI, Anthropic et Perplexity exploitent des robots séparés selon ce qu'ils font de votre contenu. Trois usages, qui n'ont ni la même valeur ni le même risque.
La recherche. Le robot lit votre page pour répondre à une question posée maintenant, et il cite sa source. C'est ce qui vous amène des visiteurs et de la notoriété.
L'agent. Un robot déclenché par un utilisateur qui a demandé quelque chose à son assistant. Il lit votre page en son nom, à sa demande, sur le moment.
L'entraînement. Votre contenu part nourrir la prochaine version du modèle. Aucune citation, aucun visiteur, aucune contrepartie immédiate.
GPTBot n'est pas OAI-SearchBot
Le nom trompe. GPTBot collecte pour l'entraînement. OAI-SearchBot alimente la recherche dans ChatGPT et produit les citations. Deux robots, deux fonctions opposées, un préfixe commun.
Même piège ailleurs. ClaudeBot pour l'entraînement, Claude-Web pour la recherche. Google-Extended concerne l'entraînement de Gemini, quand votre présence dans les AI Overviews et l'AI Mode dépend de Googlebot. PerplexityBot indexe, Perplexity-User agit à la demande.
Sept grands sites sur dix bloquent un robot de recherche
BuzzStream a analysé les robots.txt de 100 grands sites d'actualité, cinquante britanniques et cinquante américains, sélectionnés sur leur trafic. Onze robots liés à l'IA passés au crible. Le résultat, mis à jour en avril 2026 :
79 % des sites bloquent au moins un robot d'entraînement. Et 71 % bloquent au moins un robot de recherche. Le détail par robot montre où se situe la confusion.
| Robot | Fonction réelle | Sites qui le bloquent |
|---|---|---|
CCBot | Entraînement | 75 % |
anthropic-ai | Entraînement | 72 % |
ClaudeBot | Entraînement | 69 % |
PerplexityBot | Indexation | 67 % |
Claude-Web | Recherche | 66 % |
GPTBot | Entraînement | 62 % |
OAI-SearchBot | Recherche | 49 % |
Google-Extended | Entraînement | 46 % |
ChatGPT-User | Agent | 40 % |
Perplexity-User | Agent | 17 % |
Claude-Web, qui sert la recherche, est bloqué par deux tiers des sites. Presque autant que ClaudeBot, qui sert l'entraînement. Les deux robots ont été traités comme un seul, alors qu'ils font l'inverse l'un de l'autre.
Ces rédactions ont pris une décision défensive légitime : refuser que leur travail nourrisse gratuitement un modèle. Elles ont visé large et attrapé les robots qui les auraient citées.
Et le blocage ne fonctionne pas
C'est là que l'histoire devient intéressante.
Le même auteur a publié le 8 avril 2026 une seconde étude, sur 4 millions de citations issues de 3 600 requêtes adressées à ChatGPT, Gemini, aux AI Overviews et à l'AI Mode, dans dix secteurs. Question posée : est-ce que bloquer réduit les citations ?
Non.
82,4 % des sites qui bloquent OAI-SearchBot sont cités quand même. 88,2 % de ceux qui bloquent GPTBot également. 70,6 % de ceux qui bloquent ChatGPT-User apparaissent malgré tout. Vu depuis l'autre bout : 70 % des citations de ChatGPT proviennent de sites ayant bloqué un robot de recherche, et 95 % de sites ayant bloqué un robot d'entraînement.
Deux explications, non exclusives. Le contenu était déjà indexé avant le blocage. Ou les robots passent outre la directive.
Ce qui nous ramène au point de départ, et il est plus large qu'une histoire de fichier. Un Disallow n'est pas un mur. C'est un panneau. Le respecter est une politesse, pas une contrainte technique.
Déclarer n'est pas appliquer
Cette distinction explique ce que Cloudflare a livré cet été.
Le 21 août 2026, l'éditeur a lancé Bot Preference Sync. L'outil aligne automatiquement votre robots.txt sur les politiques réellement appliquées côté réseau, avec les trois catégories séparées : recherche, agent, entraînement. Disponible du plan gratuit à l'Enterprise. Le bloc généré est encadré par des marqueurs de commentaire et laisse vos règles existantes en place.
L'intérêt n'est pas le confort. Cloudflare le dit sans détour : quand votre fichier déclare une chose et que vos règles de blocage en appliquent une autre, certains crawlers traitent l'écart comme une permission de passer outre. Un robots.txt qui interdit sans que rien n'applique derrière n'est pas neutre, il invite au contournement.
Trois semaines plus tôt, le 3 juin, Google avait livré des rapports Generative AI dans Search Console : impressions dans les AI Overviews, l'AI Mode et Discover, par page, pays, appareil et date. Données à partir du 18 mai 2026, sans historique reconstitué, sans clics ni requêtes, sur un sous-ensemble de sites britanniques pour commencer. Un interrupteur permet de sortir des fonctionnalités IA sans toucher au classement organique. C'est le seul mécanisme de retrait qui soit à la fois documenté et réellement appliqué par celui qui l'a écrit. Ce que cet outil mesure, et surtout ce qu'il ne mesure pas, mérite d'être posé avant d'en faire un tableau de bord : nous l'avons détaillé dans les cinq questions à poser avant d'acheter un outil de mesure.
Le coût de laisser passer
Watizi autorise tous les crawlers IA, et la raison est écrite en commentaire dans notre fichier. Ce choix a un prix.
Cloudflare Radar mesure le rapport entre pages aspirées et visiteurs renvoyés. En mai 2026, le robot d'Anthropic affichait 10 300 pages crawlées pour un seul visiteur envoyé à l'éditeur. OpenAI a nettement progressé, de 1 104 pour 1 en juillet 2025 à 251 pour 1 en juillet 2026. Meilleur, pas bon. Au passage, plus de la moitié des requêtes HTML du web viennent désormais de machines.
Notre arbitrage est assumé, parce que nous construisons de la visibilité dans les moteurs génératifs et que sortir du corpus serait incohérent. Un site média qui vit de ses pages vues n'a aucune raison de faire le même choix.
Ce qu'il faut en tirer
Une seule ligne du tableau plus haut mérite une décision immédiate : Google-Extended. Le bloquer retire votre contenu de l'entraînement de Gemini sans rien changer à votre présence dans les AI Overviews ni à votre classement. C'est la seule mesure défensive qui ne coûte rien en visibilité, et 54 % des grands sites d'actualité ne l'ont pas prise.
Pour le reste, la leçon est moins confortable. Ni llms.txt ni robots.txt ne décident de votre présence dans les réponses IA. Le premier n'est pas lu, le second n'est pas contraignant. Ce qui décide, c'est ce que les moteurs trouvent quand ils lisent votre page, et la clarté avec laquelle votre marque y est identifiable comme entité. Le reste relève du panneau planté devant une porte ouverte. La checklist d'audit GEO couvre les signaux qui pèsent réellement.
La recherche va dans le même sens, avec un avertissement supplémentaire. La revue critique de la discipline publiée en juillet 2026 par Olivier Martinez (arXiv:2607.14035) recense les leviers dont l'effet sur la citation est mesuré, et aucun fichier déclaratif n'y figure. Un mois plus tard, une équipe conduite par Junjie Chu publiait GEO-Flag (arXiv:2608.16824), une méthode de détection du contenu sur-optimisé pour les moteurs génératifs. La manipulation devient identifiable pendant que les fichiers de déclaration restent ignorés. Structurer son identité et bricoler ses signaux ne mènent pas au même endroit.
Chez Watizi, la lecture du crawl fait partie du diagnostic. Nous ouvrons votre fichier, nous identifions les robots que vous bloquez sans le savoir, et nous mesurons ce que vous obtenez réellement en citations dans les moteurs IA.
Ouvrez votre robots.txt maintenant. S'il bloque Claude-Web ou OAI-SearchBot, vous avez pris une décision que vous ne saviez pas prendre. Et si vous comptiez dessus pour protéger votre travail, les chiffres disent qu'elle n'a même pas produit l'effet recherché.