Quando um modelo de IA com fundamentação responde a uma pergunta sobre uma marca, ele cita suas fontes. Coletamos essas citações em larga escala: 167.551 citações fundamentadas em URLs (189.974 linhas de atribuição) em 128 marcas, 13 idiomas e 12 mercados de origem, a partir de GPT, Gemini e Perplexity com busca ao vivo na web ativada.
O conjunto de dados reúne três estudos da Rankfor em um único corpus de citações, resolve os redirecionadores de fundamentação do Google de volta aos publicadores reais e marca cada citação com seu domínio, tipo de fonte, idioma e modelo. Está aberto sob CC-BY-4.0: doi.org/10.5281/zenodo.20829524.
Veja o que ele revela.
85,7% da sua reputação em IA é escrita por outra pessoa
Em todo o corpus, a IA fundamenta as respostas sobre marcas em fontes de terceiros 85,7% das vezes. O próprio site da marca responde por 14,3%.
Leia isso à luz de como os orçamentos de marketing são divididos. A maioria das equipes de marca gasta a maior parte da verba de conteúdo nos 14,3% que controla e trata os 85,7% como um problema do PR. Os modelos fazem o oposto: quando precisam descrever você, citam de forma esmagadora páginas que você nunca escreveu.
18% dos domínios carregam 80% das citações
O volume de citações segue uma lei de potência: cerca de 18% dos domínios concentram 80% de todas as citações (Zipf alpha 0,86, R² 0,983). A web de fundamentação é um clube pequeno. Uma marca que se faz descrever corretamente em algumas dezenas de domínios de alta frequência já cobriu a maior parte do que a IA algum dia vai citar sobre ela.
Quais domínios? A Wikipedia é o domínio mais citado em 11 dos 12 idiomas. A exceção é o lituano, onde o diário de negócios vz.lt fica acima dela. Se a sua presença na Wikipedia é fraca ou incorreta, ela é fraca ou incorreta em quase todos os idiomas de uma só vez.
A Polônia funciona em trilhos diferentes
A Polônia é o mercado atípico do corpus. O domínio mais citado nas respostas sobre marcas polonesas é o YouTube, e quatro portais de RH e de carreiras juntos superam a Wikipedia polonesa em citações por cerca de dois para um. Ao descrever uma marca polonesa, a IA cita seus anúncios de emprego e páginas de avaliação de empregadores com mais facilidade do que sua entrada na enciclopédia. Detalhamos essa descoberta no estudo sobre portais de emprego.
A lição se generaliza: os perfis de fundamentação são específicos de cada mercado. A lista de domínios que controla sua reputação na Alemanha é uma lista diferente na Polônia, e ninguém audita a segunda.
Os modelos também citam de forma diferente
O Perplexity é o que mais cita em volume no corpus, trazendo mais fontes por resposta do que o GPT ou o Gemini. Isso o torna o modelo mais fácil de influenciar pela amplitude (esteja presente em muitos domínios), enquanto os modelos que citam menos recompensam a profundidade (seja a melhor fonte nos poucos domínios em que confiam).
O que fazer com isso
Três ações decorrem diretamente dos dados:
- Audite os 85,7%. Liste os domínios que a IA de fato cita sobre a sua categoria (o conjunto de dados inclui as tabelas de domínios por idioma) e verifique o que eles dizem sobre você. Nossas páginas de marca do Index mostram os principais domínios de citação de cada marca medida.
- Corrija a Wikipedia e a exceção local. Um artigo correto e bem fundamentado na Wikipedia cobre 11 idiomas de fundamentação de uma só vez. Depois, encontre o vz.lt do seu mercado.
- Trate os domínios de alta frequência como parceiros de distribuição. Com 80% das citações fluindo por 18% dos domínios, dois ou três posicionamentos nos domínios certos movem mais respostas de IA do que cinquenta posts de blog no seu próprio site.
O conjunto de dados completo, o registro de análise e um script de reprodução estão no registro do Zenodo: 10.5281/zenodo.20829524. Para a pergunta complementar, o que a IA sabe sobre marcas mas não consegue citar de forma alguma, veja nosso estudo sobre opacidade de fontes, onde 70,2% do conhecimento sobre marcas não foi rastreado a nenhuma fonte.
