Lorsqu'un modèle d'IA connecté au web répond à une question sur une marque, il cite ses sources. Nous avons collecté ces citations à grande échelle : 167 551 citations avec URL sourcée (189 974 lignes d'attribution) pour 128 marques, 13 langues et 12 marchés d'origine, produites par GPT, Gemini et Perplexity avec la recherche web en direct activée.
Le jeu de données fusionne trois études Rankfor en un seul corpus de citations, ramène les redirecteurs de sourçage de Google vers les véritables éditeurs, et étiquette chaque citation avec son domaine, son type de source, sa langue et son modèle. Il est ouvert sous licence CC-BY-4.0 : doi.org/10.5281/zenodo.20829524.
Voici ce qu'il révèle.
85,7 % de votre réputation IA est écrite par quelqu'un d'autre
Sur l'ensemble du corpus, l'IA fonde ses réponses sur les marques dans des sources tierces 85,7 % du temps. Le site web de la marque elle-même en porte 14,3 %.
Comparez ce chiffre à la façon dont les budgets marketing sont répartis. La plupart des équipes de marque dépensent l'essentiel de leur budget de contenu sur les 14,3 % qu'elles contrôlent et considèrent les 85,7 % comme l'affaire des RP. Les modèles font l'inverse : quand ils ont besoin de vous décrire, ils citent en grande majorité des pages que vous n'avez jamais écrites.
18 % des domaines portent 80 % des citations
Le volume de citations suit une loi de puissance : environ 18 % des domaines représentent 80 % de toutes les citations (alpha de Zipf 0,86, R² 0,983). Le web de sourçage est un club restreint. Une marque qui se fait décrire correctement sur quelques dizaines de domaines à haute fréquence a couvert l'essentiel de ce que l'IA citera un jour à son sujet.
Quels domaines ? Wikipedia est le domaine le plus cité dans 11 des 12 langues. L'exception est le lituanien, où le quotidien économique vz.lt le devance. Si votre présence sur Wikipedia est mince ou erronée, elle l'est dans presque toutes les langues à la fois.
La Pologne roule sur d'autres rails
La Pologne est le marché atypique du corpus. Le domaine le plus cité pour les réponses sur les marques polonaises est YouTube, et quatre portails RH et emploi cumulés surpassent Wikipedia en polonais dans un rapport d'environ deux pour un. Une IA qui décrit une marque polonaise cite plus volontiers ses offres d'emploi et ses pages d'avis d'employés que sa fiche encyclopédique. Nous détaillons ce constat dans l'étude sur les sites d'emploi.
La leçon se généralise : les profils de sourçage sont propres à chaque marché. La liste de domaines qui contrôle votre réputation en Allemagne est une autre liste en Pologne, et personne n'audite la seconde.
Les modèles citent aussi différemment
Perplexity est le plus gros citateur du corpus, produisant plus de sources par réponse que GPT ou Gemini. Cela en fait le modèle le plus facile à influencer par l'étendue (être présent sur de nombreux domaines), tandis que les citateurs plus économes récompensent la profondeur (être la meilleure source sur les quelques domaines auxquels ils font confiance).
Que faire de tout cela
Trois actions découlent directement des données :
- Auditez les 85,7 %. Listez les domaines que l'IA cite réellement à propos de votre catégorie (le jeu de données inclut les tableaux de domaines par langue) et vérifiez ce qu'ils disent de vous. Nos pages de marque de l'Index montrent les principaux domaines de citation de chaque marque mesurée.
- Corrigez Wikipedia et l'exception locale. Un article Wikipedia exact et bien sourcé couvre le sourçage dans 11 langues d'un seul coup. Trouvez ensuite le vz.lt de votre marché.
- Traitez les domaines à haute fréquence comme des partenaires de distribution. Avec 80 % des citations qui passent par 18 % des domaines, deux ou trois placements sur les bons déplacent plus de réponses d'IA que cinquante articles de blog sur votre propre site.
Le jeu de données complet, le registre d'analyse et un script de reproduction se trouvent dans l'enregistrement Zenodo : 10.5281/zenodo.20829524. Pour la question complémentaire, à savoir ce que l'IA sait des marques sans pouvoir le citer, consultez notre étude sur l'opacité du sourçage, où 70,2 % de la connaissance des marques ne remontait à aucune source.
