La visibilité d'une marque dans les moteurs IA se mesure, elle ne s'estime pas. Une mesure fiable exige trois conditions : 7 à 8 répétitions par prompt, comptabilisation des non-activations, 3 paraphrases par intention. Sans elles, les sources citées changent d'un jour à l'autre.
Ce qu'un taux de citation ne dit pas
Un tableau de bord affiche « votre marque est citée dans 23 % des réponses ». Une seule question compte : 23 % de quoi ?
Trois informations manquent presque toujours. Le dénominateur, c'est-à-dire sur combien de requêtes, en comptant ou non celles où le moteur n'a cité personne. Le nombre de répétitions par prompt. Le nombre de reformulations testées pour une même intention d'achat.
Sans elles, le chiffre n'est pas faux. Il est vide.
Julius Schulte et ses coauteurs ont interrogé quatre moteurs pendant 45 jours (arXiv:2604.07585). L'indice de Jaccard quotidien au niveau des sources oscille entre 0,34 et 0,42, y compris entre deux mesures espacées de moins de vingt-quatre heures. D'un jour sur l'autre, la majorité des sources citées change. Elisabeth Kirsten et son équipe, dans les Findings of the Association for Computational Linguistics: ACL 2026 (p. 10827-10848), mesurent un recouvrement de pages de 18 % sur deux mois pour les AI Overviews, contre 45 % pour le Google organique. Même à température zéro, des exécutions répétées font bouger 9 à 28 % des décisions de citation.
Une mesure ponctuelle unique n'est donc pas un indicateur. C'est un tirage aléatoire présenté comme un score. C'est aussi pourquoi votre part de voix dans les moteurs IA se lit sur une série de mesures, jamais sur un point isolé.
AI search monitoring ou LLM monitoring : deux produits, un seul nom
Le marché vend deux choses sous la même étiquette. L'AI search monitoring observe ce que les utilisateurs voient réellement, réponses affichées et citations comprises. Le LLM monitoring sonde la connaissance d'entraînement du modèle, sans aucune donnée de citation.
Les deux répondent à des questions différentes. La quasi-totalité des besoins commerciaux relève du premier. La facture, elle, est souvent la même. Posez la question avant de signer.
Reconnaissance ou découverte : l'écart que personne ne mesure
Un chiffre résume le problème mieux que tous les autres. Amit Prakash Sharma a testé 112 startups sur ChatGPT et Perplexity (arXiv:2601.00912). Interrogé sur un produit par son nom, ChatGPT le reconnaît dans 99,4 % des cas. Interrogé sur une catégorie, c'est-à-dire de la façon dont les acheteurs cherchent vraiment, il le recommande dans 3,32 % des cas. Perplexity tombe de 94,3 % à 8,29 %.
Trente contre un.
Reconnaissance nommée Découverte générique
Cet écart change la nature du problème. Une marque peut être parfaitement encodée dans les poids d'un modèle et totalement absente de ses recommandations. Être connue ne signifie pas être proposée. Un tableau de bord qui n'interroge que des prompts de marque mesure la première chose et vend la seconde.
Le test en trente secondes. Ouvrez ChatGPT. Demandez qui est votre entreprise, il répondra. Demandez ensuite de recommander trois prestataires dans votre catégorie, sans citer votre nom. Regardez qui apparaît. L'écart entre les deux réponses est exactement ce qu'une prestation de visibilité IA doit réduire.
Cette étude est un préprint, non relu par les pairs. Elle vaut donc un niveau B sur l'échelle présentée plus bas, pas un niveau A. Le dire fait partie du travail.
Les cinq questions à poser
1. Combien de répétitions par prompt ?
Sept à huit exécutions minimum, à ajuster ensuite selon la précision recherchée. En dessous, l'intervalle de confiance est trop large pour arbitrer quoi que ce soit. Rares sont les plateformes qui publient ce chiffre. C'est la première question, et elle disqualifie vite.
2. Les non-activations sont-elles comptées ?
Dans le protocole de Schulte, 57,8 % des répétitions ChatGPT n'ont pas déclenché de recherche web. Un outil qui calcule une part de citations uniquement parmi les réponses contenant des citations, puis la présente comme une visibilité globale, commet un biais de sélection. Les sorties sans recherche et sans citation sont des résultats, pas des données à écarter.
3. Combien de paraphrases par intention ?
Trois à cinq variantes par besoin. Les travaux de Grossman et ses coauteurs, présentés à SIGIR 2026 sur 11 500 requêtes, montrent que des reformulations mineures modifient davantage les sources des AI Overviews que les résultats organiques. Tester une seule formulation par intention revient à mesurer une phrase, pas un marché.
4. Mesure par API ou par interface réelle ?
Les mesures par API divergent jusqu'à 25 % des réponses réellement affichées à l'utilisateur. Les plateformes haut de gamme scrapent l'interface pour cette raison précise. Toute comparaison entre deux outils doit préciser le canal de collecte, sinon elle compare deux objets différents.
5. D'où viennent les prompts ?
Panels synthétiques générés par un modèle, ou requêtes dérivées de recherches réelles ? La différence décide de tout. Un panel synthétique mesure ce qu'un modèle imagine de votre marché. Il ne mesure pas votre marché.
| Question | Réponse acceptable | Réponse qui doit alerter |
|---|---|---|
| Répétitions par prompt | 7 à 8, avec intervalle de confiance au rapport | « La mesure est quotidienne » |
| Dénominateur | Taux d'activation reporté à part | Un pourcentage seul, sans base |
| Paraphrases | 3 à 5 par intention, moyennées | Une formulation par mot-clé |
| Canal de collecte | Interface réelle, canal précisé | Silence sur le sujet |
| Origine des prompts | Requêtes réelles, versionnées | « Notre IA génère les prompts » |
Grader une affirmation de visibilité : l'échelle A-E
La revue critique de référence sur le sujet (Olivier Martinez, arXiv:2607.14035, 45 études sur la fenêtre novembre 2023 à juillet 2026) propose une échelle pour classer n'importe quelle affirmation de performance.
| Niveau | Type de preuve |
|---|---|
| A | Essai de terrain randomisé, avec logs serveur |
| B | Moteurs live, répétitions, paraphrases, mesures multi-dates |
| C | Système commercial avec URLs fournies manuellement |
| D | Pipeline RAG reproductible en laboratoire |
| E | Contexte fixe et juge LLM |
Le verdict de la revue est sans détour : la quasi-totalité des affirmations marketing du marché relève des niveaux C à E, présentées comme du niveau A.
Appliquons l'échelle aux chiffres de cet article, faute de quoi il ne vaudrait pas mieux que ce qu'il critique.
- Recouvrement de 18 % sur deux mois (Kirsten et al.) : niveau B, relu par les pairs et publié dans les Findings de l'ACL. Le plus solide du lot.
- Jaccard quotidien de 0,34 à 0,42 (Schulte et al.) : niveau B, préprint.
- Écart 99,4 % contre 3,32 % (Sharma) : niveau B, préprint.
- Le « +40 % de visibilité » du papier fondateur (Aggarwal et ses coauteurs, Princeton, Georgia Tech et IIT, KDD 2024), encore repris partout : niveau E. Cinq documents déjà injectés dans un contexte fixe, une métrique de part de mots pondérée par la position, un juge LLM de la même famille que le générateur. Le gain est réel dans son cadre. Il ne dit rien de la probabilité d'être récupéré par le moteur.
Ce qu'aucun outil ne peut promettre
Le maillon comportemental, clic et conversion, reste le niveau de preuve le plus bas du champ. L'étude la plus rigoureuse à ce jour (Watanabe et Nakayashiki, 2026) analyse les logs d'un site dont une partie des pages seulement a reçu une intervention. Les referrals ChatGPT y sont multipliés par 5,7 en brut. Mais les pages non traitées le sont par 3,5, simple croissance de la plateforme. L'analyse contrôlée en séries temporelles estime le multiplicateur additionnel à 1,82, avec un intervalle de confiance à 95 % de 1,31 à 2,54, et un placebo temporel à p = 0,16. Effet suggestif. Pas établi causalement.
Conséquence directe : personne ne peut aujourd'hui garantir un gain de trafic issu de la visibilité IA. Un prestataire qui annonce un pourcentage vend du niveau E au prix du niveau A.
Ce qui reste défendable se situe en amont. Les deux facteurs les plus reproductibles de tout le corpus sont la pertinence entre la requête et le document, et la position dans le contexte, autrement dit le retrieval. Cela valide le travail sur l'identité d'entité et sur le réseau de sources tierces. Cela invalide les recettes de réécriture : sur 54 combinaisons méthode et domaine testées par l'équipe du UKP Lab (C-SEO Bench, 2025), 3 seulement ressortent significativement positives, et dix heuristiques e-commerce sur quinze se révèlent neutres ou négatives en test contrôlé.
Un tableau de bord ne remplace pas ce travail. Il dit s'il produit un effet, et à quelle étape du pipeline. C'est déjà beaucoup, à condition qu'il soit construit pour ça. Pour situer ce chantier dans l'ensemble, voir le guide du Generative Engine Optimization.
Le Diagnostic IA mesure l'écart entre reconnaissance et découverte sur votre marque, moteur par moteur, sous 48 heures.
Sources
- Martinez O., Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026), arXiv:2607.14035, 15 juillet 2026. Revue de 45 études.
- Kirsten E., Große Perdekamp J., Wu Q., Upadhyay M., Gummadi K. P., Zafar M. B., Characterizing Web Search in the Age of Generative AI, Findings of the ACL 2026, p. 10827-10848. Relu par les pairs.
- Schulte J., Bleeker M., Kaufmann P., Don't Measure Once: Measuring Visibility in AI Search (GEO), arXiv:2604.07585. Préprint.
- Sharma A. P., The Discovery Gap: How Product Hunt Startups Vanish in LLM Organic Discovery Queries, arXiv:2601.00912. Préprint.
- Aggarwal P. et al. (Princeton, Georgia Tech, IIT), GEO: Generative Engine Optimization, KDD 2024. Relu par les pairs.
- Puerto H. et al. (UKP Lab, TU Darmstadt), C-SEO Bench, 2025.
- Couverture presse du survey : PPC Land, juillet 2026.
Un chiffre sans méthode n'est pas une mesure. C'est une opinion avec des décimales.