visibilité IA Part de Voix IA monitoring IA GEO mesure

Visibilité IA : les cinq questions à poser avant d'acheter un tableau de bord

Le marché du suivi de visibilité IA a levé plus de 300 M$ en un an. Presque aucun outil ne publie son nombre de répétitions par prompt. Voici les cinq questions qui séparent une mesure d'un tirage aléatoire.

8 min de lecture Par Philippe Trento
Visibilité IA : 5 questions avant d'acheter un outil
Écouter le podcast

Le marché du suivi de visibilité IA a levé plus de 300 M$ en un an. Presque aucun outil ne publie son nombre de répétitions par prompt. Voici les cinq questions qui séparent une mesure d'un tirage aléatoire.

La visibilité d'une marque dans les moteurs IA se mesure, elle ne s'estime pas. Une mesure fiable exige trois conditions : 7 à 8 répétitions par prompt, comptabilisation des non-activations, 3 paraphrases par intention. Sans elles, les sources citées changent d'un jour à l'autre.

Ce qu'un taux de citation ne dit pas

Un tableau de bord affiche « votre marque est citée dans 23 % des réponses ». Une seule question compte : 23 % de quoi ?

Trois informations manquent presque toujours. Le dénominateur, c'est-à-dire sur combien de requêtes, en comptant ou non celles où le moteur n'a cité personne. Le nombre de répétitions par prompt. Le nombre de reformulations testées pour une même intention d'achat.

Sans elles, le chiffre n'est pas faux. Il est vide.

Julius Schulte et ses coauteurs ont interrogé quatre moteurs pendant 45 jours (arXiv:2604.07585). L'indice de Jaccard quotidien au niveau des sources oscille entre 0,34 et 0,42, y compris entre deux mesures espacées de moins de vingt-quatre heures. D'un jour sur l'autre, la majorité des sources citées change. Elisabeth Kirsten et son équipe, dans les Findings of the Association for Computational Linguistics: ACL 2026 (p. 10827-10848), mesurent un recouvrement de pages de 18 % sur deux mois pour les AI Overviews, contre 45 % pour le Google organique. Même à température zéro, des exécutions répétées font bouger 9 à 28 % des décisions de citation.

Une mesure ponctuelle unique n'est donc pas un indicateur. C'est un tirage aléatoire présenté comme un score. C'est aussi pourquoi votre part de voix dans les moteurs IA se lit sur une série de mesures, jamais sur un point isolé.

AI search monitoring ou LLM monitoring : deux produits, un seul nom

Le marché vend deux choses sous la même étiquette. L'AI search monitoring observe ce que les utilisateurs voient réellement, réponses affichées et citations comprises. Le LLM monitoring sonde la connaissance d'entraînement du modèle, sans aucune donnée de citation.

Les deux répondent à des questions différentes. La quasi-totalité des besoins commerciaux relève du premier. La facture, elle, est souvent la même. Posez la question avant de signer.

Reconnaissance ou découverte : l'écart que personne ne mesure

Un chiffre résume le problème mieux que tous les autres. Amit Prakash Sharma a testé 112 startups sur ChatGPT et Perplexity (arXiv:2601.00912). Interrogé sur un produit par son nom, ChatGPT le reconnaît dans 99,4 % des cas. Interrogé sur une catégorie, c'est-à-dire de la façon dont les acheteurs cherchent vraiment, il le recommande dans 3,32 % des cas. Perplexity tombe de 94,3 % à 8,29 %.

Trente contre un.

Reconnaissance nommée Découverte générique

Écart entre reconnaissance nommée et découverte générique ChatGPT reconnaît 99,4 % des produits nommés mais n'en recommande que 3,32 % sur une requête de catégorie. Perplexity passe de 94,3 % à 8,29 %. ChatGPT Perplexity 99,4 % 3,32 % 94,3 % 8,29 % 0 25 50 75 100 %
Part des produits reconnus quand ils sont nommés, contre part des produits recommandés sur une requête de catégorie. 112 startups testées (Sharma, arXiv:2601.00912, préprint).

Cet écart change la nature du problème. Une marque peut être parfaitement encodée dans les poids d'un modèle et totalement absente de ses recommandations. Être connue ne signifie pas être proposée. Un tableau de bord qui n'interroge que des prompts de marque mesure la première chose et vend la seconde.

Le test en trente secondes. Ouvrez ChatGPT. Demandez qui est votre entreprise, il répondra. Demandez ensuite de recommander trois prestataires dans votre catégorie, sans citer votre nom. Regardez qui apparaît. L'écart entre les deux réponses est exactement ce qu'une prestation de visibilité IA doit réduire.

Cette étude est un préprint, non relu par les pairs. Elle vaut donc un niveau B sur l'échelle présentée plus bas, pas un niveau A. Le dire fait partie du travail.

Les cinq questions à poser

1. Combien de répétitions par prompt ?

Sept à huit exécutions minimum, à ajuster ensuite selon la précision recherchée. En dessous, l'intervalle de confiance est trop large pour arbitrer quoi que ce soit. Rares sont les plateformes qui publient ce chiffre. C'est la première question, et elle disqualifie vite.

2. Les non-activations sont-elles comptées ?

Dans le protocole de Schulte, 57,8 % des répétitions ChatGPT n'ont pas déclenché de recherche web. Un outil qui calcule une part de citations uniquement parmi les réponses contenant des citations, puis la présente comme une visibilité globale, commet un biais de sélection. Les sorties sans recherche et sans citation sont des résultats, pas des données à écarter.

3. Combien de paraphrases par intention ?

Trois à cinq variantes par besoin. Les travaux de Grossman et ses coauteurs, présentés à SIGIR 2026 sur 11 500 requêtes, montrent que des reformulations mineures modifient davantage les sources des AI Overviews que les résultats organiques. Tester une seule formulation par intention revient à mesurer une phrase, pas un marché.

4. Mesure par API ou par interface réelle ?

Les mesures par API divergent jusqu'à 25 % des réponses réellement affichées à l'utilisateur. Les plateformes haut de gamme scrapent l'interface pour cette raison précise. Toute comparaison entre deux outils doit préciser le canal de collecte, sinon elle compare deux objets différents.

5. D'où viennent les prompts ?

Panels synthétiques générés par un modèle, ou requêtes dérivées de recherches réelles ? La différence décide de tout. Un panel synthétique mesure ce qu'un modèle imagine de votre marché. Il ne mesure pas votre marché.

QuestionRéponse acceptableRéponse qui doit alerter
Répétitions par prompt7 à 8, avec intervalle de confiance au rapport« La mesure est quotidienne »
DénominateurTaux d'activation reporté à partUn pourcentage seul, sans base
Paraphrases3 à 5 par intention, moyennéesUne formulation par mot-clé
Canal de collecteInterface réelle, canal préciséSilence sur le sujet
Origine des promptsRequêtes réelles, versionnées« Notre IA génère les prompts »

Grader une affirmation de visibilité : l'échelle A-E

La revue critique de référence sur le sujet (Olivier Martinez, arXiv:2607.14035, 45 études sur la fenêtre novembre 2023 à juillet 2026) propose une échelle pour classer n'importe quelle affirmation de performance.

NiveauType de preuve
AEssai de terrain randomisé, avec logs serveur
BMoteurs live, répétitions, paraphrases, mesures multi-dates
CSystème commercial avec URLs fournies manuellement
DPipeline RAG reproductible en laboratoire
EContexte fixe et juge LLM

Le verdict de la revue est sans détour : la quasi-totalité des affirmations marketing du marché relève des niveaux C à E, présentées comme du niveau A.

Appliquons l'échelle aux chiffres de cet article, faute de quoi il ne vaudrait pas mieux que ce qu'il critique.

  • Recouvrement de 18 % sur deux mois (Kirsten et al.) : niveau B, relu par les pairs et publié dans les Findings de l'ACL. Le plus solide du lot.
  • Jaccard quotidien de 0,34 à 0,42 (Schulte et al.) : niveau B, préprint.
  • Écart 99,4 % contre 3,32 % (Sharma) : niveau B, préprint.
  • Le « +40 % de visibilité » du papier fondateur (Aggarwal et ses coauteurs, Princeton, Georgia Tech et IIT, KDD 2024), encore repris partout : niveau E. Cinq documents déjà injectés dans un contexte fixe, une métrique de part de mots pondérée par la position, un juge LLM de la même famille que le générateur. Le gain est réel dans son cadre. Il ne dit rien de la probabilité d'être récupéré par le moteur.

Ce qu'aucun outil ne peut promettre

Le maillon comportemental, clic et conversion, reste le niveau de preuve le plus bas du champ. L'étude la plus rigoureuse à ce jour (Watanabe et Nakayashiki, 2026) analyse les logs d'un site dont une partie des pages seulement a reçu une intervention. Les referrals ChatGPT y sont multipliés par 5,7 en brut. Mais les pages non traitées le sont par 3,5, simple croissance de la plateforme. L'analyse contrôlée en séries temporelles estime le multiplicateur additionnel à 1,82, avec un intervalle de confiance à 95 % de 1,31 à 2,54, et un placebo temporel à p = 0,16. Effet suggestif. Pas établi causalement.

Conséquence directe : personne ne peut aujourd'hui garantir un gain de trafic issu de la visibilité IA. Un prestataire qui annonce un pourcentage vend du niveau E au prix du niveau A.

Ce qui reste défendable se situe en amont. Les deux facteurs les plus reproductibles de tout le corpus sont la pertinence entre la requête et le document, et la position dans le contexte, autrement dit le retrieval. Cela valide le travail sur l'identité d'entité et sur le réseau de sources tierces. Cela invalide les recettes de réécriture : sur 54 combinaisons méthode et domaine testées par l'équipe du UKP Lab (C-SEO Bench, 2025), 3 seulement ressortent significativement positives, et dix heuristiques e-commerce sur quinze se révèlent neutres ou négatives en test contrôlé.

Un tableau de bord ne remplace pas ce travail. Il dit s'il produit un effet, et à quelle étape du pipeline. C'est déjà beaucoup, à condition qu'il soit construit pour ça. Pour situer ce chantier dans l'ensemble, voir le guide du Generative Engine Optimization.

Le Diagnostic IA mesure l'écart entre reconnaissance et découverte sur votre marque, moteur par moteur, sous 48 heures.

Sources

  • Martinez O., Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026), arXiv:2607.14035, 15 juillet 2026. Revue de 45 études.
  • Kirsten E., Große Perdekamp J., Wu Q., Upadhyay M., Gummadi K. P., Zafar M. B., Characterizing Web Search in the Age of Generative AI, Findings of the ACL 2026, p. 10827-10848. Relu par les pairs.
  • Schulte J., Bleeker M., Kaufmann P., Don't Measure Once: Measuring Visibility in AI Search (GEO), arXiv:2604.07585. Préprint.
  • Sharma A. P., The Discovery Gap: How Product Hunt Startups Vanish in LLM Organic Discovery Queries, arXiv:2601.00912. Préprint.
  • Aggarwal P. et al. (Princeton, Georgia Tech, IIT), GEO: Generative Engine Optimization, KDD 2024. Relu par les pairs.
  • Puerto H. et al. (UKP Lab, TU Darmstadt), C-SEO Bench, 2025.
  • Couverture presse du survey : PPC Land, juillet 2026.

Un chiffre sans méthode n'est pas une mesure. C'est une opinion avec des décimales.

FAQ

Questions fréquentes

Combien de fois faut-il interroger un moteur IA pour obtenir une mesure fiable ?

Sept à huit répétitions par prompt constituent le point de départ recommandé par la littérature 2026, à affiner ensuite par analyse séquentielle jusqu'à ce que l'intervalle de confiance soit assez étroit pour la décision visée. Une mesure unique n'a pas de valeur décisionnelle.

Quelle différence entre AI search monitoring et LLM monitoring ?

L'AI search monitoring mesure ce que les utilisateurs voient dans les réponses affichées, citations incluses. Le LLM monitoring interroge la connaissance d'entraînement du modèle, sans données de citation. Pour une marque qui veut savoir si elle est recommandée, seul le premier répond à la question.

Pourquoi ma marque est-elle reconnue par ChatGPT mais jamais recommandée ?

Parce que la reconnaissance nommée et la découverte générique sont deux mécanismes distincts. Sur 112 startups testées, ChatGPT reconnaît 99,4 % des produits nommés mais n'en recommande que 3,32 % sur une requête de catégorie. Encoder une entité dans un modèle n'implique pas de la proposer.

Peut-on garantir un gain de trafic grâce à la visibilité IA ?

Non. Aucune technique du corpus scientifique ne démontre d'effet causal stable, longitudinal et multi-moteurs sur la découvrabilité organique ni sur les conversions. Un engagement de méthodologie est défendable. Une métrique garantie au contrat ne l'est pas.

Peut-on comparer le taux de citation de deux outils différents ?

Seulement si les deux publient leur dénominateur, leur nombre de répétitions, leur canal de collecte et la période de mesure. Deux taux d'activation différents ne sont pas contradictoires si les distributions de requêtes diffèrent. Un taux sans description d'échantillon n'est pas transportable.

Évaluez votre maturité GEO en 48 h

Diagnostic Entity Health + ESR + Signal Coherence offert.

Écrit par
PT
Philippe Trento CEO & fondateur · Watizi

Entrepreneur du digital depuis 2000. Premières années chez Wanadoo, puis 10 ans chez Orange, ensuite un acteur du groupe Le Figaro. Spécialiste en stratégie IA, ingénierie des entités (GEO/AEO) et transformation digitale des PME.

Voir le profil LinkedIn
La suite par email

Cette analyse vous a servi ? La prochaine arrive dans votre boîte.

Une à deux fois par mois, la tribune du studio avec ses sources, et l'épisode audio quand il existe.

Une à deux fois par mois. Désinscription en un clic dans chaque email. Politique de confidentialité.