Wenn ein KI-Modell mit Web-Zugriff eine Frage zu einer Marke beantwortet, nennt es seine Quellen. Wir haben diese Quellenangaben in großem Umfang erfasst: 167.551 URL-gestützte Quellenangaben (189.974 Zuordnungszeilen) über 128 Marken, 13 Sprachen und 12 Heimatmärkte, von GPT, Gemini und Perplexity mit aktivierter Live-Websuche.
Der Datensatz führt drei Rankfor-Studien zu einem einzigen Zitierkorpus zusammen, löst Googles Grounding-Weiterleitungen zu den tatsächlichen Publishern auf und versieht jede Quellenangabe mit Domain, Quellentyp, Sprache und Modell. Er ist unter CC-BY-4.0 frei verfügbar: doi.org/10.5281/zenodo.20829524.
Das zeigt er.
85,7 % Ihres KI-Rufs schreibt jemand anderes
Über den gesamten Korpus hinweg stützt KI ihre Markenantworten zu 85,7 % auf Drittquellen. Die eigene Website der Marke trägt 14,3 % bei.
Halten Sie das gegen die Aufteilung der Marketingbudgets. Die meisten Markenteams stecken den Großteil ihres Content-Budgets in die 14,3 %, die sie kontrollieren, und behandeln die 85,7 % als das Problem der PR-Abteilung. Die Modelle sehen es genau umgekehrt: Wenn sie Sie beschreiben sollen, zitieren sie ganz überwiegend Seiten, die Sie nie geschrieben haben.
18 % der Domains tragen 80 % der Quellenangaben
Das Zitiervolumen folgt einem Potenzgesetz: Rund 18 % der Domains machen 80 % aller Quellenangaben aus (Zipf-Alpha 0,86, R² 0,983). Das Grounding-Web ist ein kleiner Club. Eine Marke, die sich auf ein paar Dutzend häufig zitierten Domains korrekt beschreiben lässt, hat den größten Teil dessen abgedeckt, was KI je über sie zitieren wird.
Welche Domains? Wikipedia ist in 11 der 12 Sprachen die am häufigsten zitierte Domain. Die Ausnahme ist Litauisch, wo die Wirtschaftszeitung vz.lt vor ihr liegt. Wenn Ihre Präsenz auf Wikipedia dünn oder fehlerhaft ist, dann ist sie in fast jeder Sprache gleichzeitig dünn oder fehlerhaft.
Polen läuft auf anderen Schienen
Polen ist der Ausreißermarkt des Korpus. Die am häufigsten zitierte Domain für polnische Markenantworten ist YouTube, und vier HR- und Karriereportale zusammen überholen die polnische Wikipedia mit einem Verhältnis von etwa zwei zu eins. KI, die eine polnische Marke beschreibt, zitiert deren Stellenanzeigen und Arbeitgeber-Bewertungsseiten bereitwilliger als ihren Enzyklopädie-Eintrag. Diesen Befund schlüsseln wir in der Jobbörsen-Studie auf.
Die Lektion lässt sich verallgemeinern: Grounding-Profile sind marktspezifisch. Die Domain-Liste, die Ihren Ruf in Deutschland bestimmt, ist in Polen eine andere Liste, und die zweite prüft niemand.
Auch die Modelle zitieren unterschiedlich
Perplexity zitiert im Korpus am volumenstärksten und führt pro Antwort mehr Quellen an als GPT oder Gemini. Das macht es zum Modell, das sich am leichtesten über Breite beeinflussen lässt (auf vielen Domains präsent sein), während die sparsameren Zitierer Tiefe belohnen (die beste Quelle auf den wenigen Domains sein, denen sie vertrauen).
Was daraus folgt
Drei Schritte ergeben sich direkt aus den Daten:
- Prüfen Sie die 85,7 %. Listen Sie die Domains auf, die KI tatsächlich zu Ihrer Kategorie zitiert (der Datensatz enthält die Domain-Tabellen je Sprache) und prüfen Sie, was sie über Sie sagen. Unsere Index-Markenseiten zeigen für jede gemessene Marke die am häufigsten zitierten Domains.
- Korrigieren Sie Wikipedia und die lokale Ausnahme. Ein korrekter, gut belegter Wikipedia-Artikel deckt 11 Sprachen des Groundings auf einmal ab. Finden Sie anschließend das vz.lt Ihres Marktes.
- Behandeln Sie häufig zitierte Domains als Distributionspartner. Da 80 % der Quellenangaben über 18 % der Domains fließen, bewegen zwei oder drei Platzierungen auf den richtigen Domains mehr KI-Antworten als fünfzig Blogbeiträge auf Ihrer eigenen Website.
Der vollständige Datensatz, das Analyse-Protokoll und ein Reproduktionsskript liegen im Zenodo-Eintrag: 10.5281/zenodo.20829524. Für die Anschlussfrage, was KI über Marken weiß, das sie überhaupt nicht belegen kann, siehe unsere Studie zur Quellenopazität, in der sich 70,2 % des Markenwissens auf keine Quelle zurückführen ließen.
