Cuando un modelo de IA con acceso a datos reales responde una pregunta sobre una marca, cita sus fuentes. Recopilamos esas citas a gran escala: 167.551 citas ancladas a URLs (189.974 filas de atribución) en 128 marcas, 13 idiomas y 12 mercados de origen, procedentes de GPT, Gemini y Perplexity con la búsqueda web en vivo activada.
El conjunto de datos fusiona tres estudios de Rankfor en un único corpus de citas, resuelve los redirectores de anclaje de Google hasta los editores reales y etiqueta cada cita con su dominio, tipo de fuente, idioma y modelo. Es abierto bajo CC-BY-4.0: doi.org/10.5281/zenodo.20829524.
Esto es lo que muestra.
El 85,7% de tu reputación ante la IA la escribe otra persona
En todo el corpus, la IA fundamenta las respuestas sobre marcas en fuentes de terceros el 85,7% de las veces. El sitio web propio de la marca aporta el 14,3%.
Contrasta eso con cómo se reparten los presupuestos de marketing. La mayoría de los equipos de marca gastan casi todo su dinero en contenido en el 14,3% que controlan y tratan el 85,7% como un problema de relaciones públicas. Los modelos lo hacen al revés: cuando necesitan describirte, citan mayoritariamente páginas que tú nunca escribiste.
El 18% de los dominios concentra el 80% de las citas
El volumen de citas sigue una ley de potencias: alrededor del 18% de los dominios concentra el 80% de todas las citas (alfa de Zipf 0,86, R² 0,983). La web que la IA usa como base es un club pequeño. Una marca que consigue que la describan correctamente en unas pocas docenas de dominios de alta frecuencia ha cubierto la mayor parte de lo que la IA llegará a citar sobre ella.
¿Qué dominios? Wikipedia es el dominio más citado en 11 de los 12 idiomas. La excepción es el lituano, donde el diario económico vz.lt lo supera. Si tu presencia en Wikipedia es escasa o incorrecta, es escasa o incorrecta en casi todos los idiomas a la vez.
Polonia funciona sobre otras vías
Polonia es el mercado atípico del corpus. El dominio más citado en las respuestas sobre marcas polacas es YouTube, y cuatro portales de empleo y carreras profesionales juntos superan en citas a la Wikipedia polaca por una proporción aproximada de dos a uno. Cuando la IA describe una marca polaca, cita antes sus ofertas de empleo y sus páginas de reseñas de empleadores que su entrada en la enciclopedia. Analizamos ese hallazgo en el estudio sobre portales de empleo.
La lección se generaliza: los perfiles de fuentes son específicos de cada mercado. La lista de dominios que controla tu reputación en Alemania es una lista distinta en Polonia, y nadie audita la segunda.
Los modelos también citan de forma distinta
Perplexity es el que más cita del corpus, aportando más fuentes por respuesta que GPT o Gemini. Eso lo convierte en el modelo más fácil de influir a través de la amplitud (estar presente en muchos dominios), mientras que los que citan menos premian la profundidad (ser la mejor fuente en los pocos dominios en los que confían).
Qué hacer con esto
Del análisis se derivan directamente tres movimientos:
- Audita el 85,7%. Enumera los dominios que la IA realmente cita sobre tu categoría (el conjunto de datos incluye las tablas de dominios por idioma) y comprueba qué dicen de ti. Nuestras páginas de marca del Index muestran los principales dominios de citas de cada marca medida.
- Corrige Wikipedia y la excepción local. Un artículo de Wikipedia correcto y bien documentado cubre 11 idiomas de fuentes a la vez. Después, encuentra el vz.lt de tu mercado.
- Trata los dominios de alta frecuencia como socios de distribución. Con el 80% de las citas fluyendo a través del 18% de los dominios, dos o tres colocaciones en los adecuados mueven más respuestas de IA que cincuenta entradas de blog en tu propio sitio.
El conjunto de datos completo, el registro de análisis y un script de reproducción están en el registro de Zenodo: 10.5281/zenodo.20829524. Para la pregunta complementaria, qué sabe la IA sobre las marcas que no puede citar en absoluto, consulta nuestro estudio sobre la opacidad de las fuentes, donde el 70,2% del conocimiento sobre marcas no se pudo rastrear a ninguna fuente.
