article

PersonaGen-15K: el primer conjunto de datos abierto de buyer personas generadas por IA

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15,000 buyer personas publicadas en HuggingFace para validar qué cree la IA que quieren tus clientes, y por qué no publicamos las 593K completas.


Por qué publicamos este conjunto de datos

La mayoría de los conjuntos de datos de buyer personas son ruido sintético o están bloqueados tras muros de pago empresariales. Publicamos PersonaGen-15K en HuggingFace para demostrar algo distinto: las personas generadas por IA no son alucinaciones; son un reflejo de lo que los modelos de IA aprenden de la web.

Es un subconjunto de 15,000 personas extraído de nuestro conjunto completo de 593,181 personas, una muestra histórica del 10% de la versión anterior de 149K, publicada en la revista Discover Artificial Intelligence de Springer. Está estratificado por sector, anonimizado y comprimido en un único archivo Parquet de 8.9 MB. El conjunto de datos completo es la base de nuestra plataforma comercial de inteligencia de visibilidad en IA. Este subconjunto es la prueba.

Si eres investigador, científico de datos o tecnólogo de marketing y te preguntas si las personas generadas por IA realmente se corresponden con el comportamiento real de los compradores, este es tu conjunto de validación. Si estás evaluando si licenciar el conjunto de datos completo para tu producto o tu investigación, esta es tu comprobación de calidad.

Puedes descargarlo aquí: PersonaGen-15K en HuggingFace.


Qué contiene el conjunto de datos

PersonaGen-15K contiene 14,955 buyer personas de 25 sectores, generadas con Gemini 2.0 Flash de Google. Cada persona incluye:

  • Datos demográficos: Rango de edad, formación, función laboral, tamaño de la empresa
  • Objetivos: Lo que intentan conseguir (metas de negocio, resultados personales)
  • Puntos de dolor: Fricción operativa, restricciones presupuestarias, carencias de capacidades
  • Consultas de búsqueda: Las preguntas que hacen a los asistentes de IA y a los buscadores
  • Necesidades no expresadas: Requisitos implícitos que no aparecen en las búsquedas pero que se revelan mediante el análisis del comportamiento
  • Contexto de mercado: Sector, presiones competitivas, entorno regulatorio
  • Detonantes de compra: Eventos que los hacen pasar de la investigación a la evaluación

El conjunto de datos se almacena en formato Parquet comprimido con ZSTD para una carga eficiente en pandas, Polars o DuckDB. La distribución por sector se conserva dentro de un 0.2% respecto al conjunto de datos original, lo que significa que la muestra estratificada es estadísticamente representativa.

PersonaGen-15K: composición del conjunto de datos

14,95574,40044,90045,00074,10025PersonasConsultas de búsquedaPuntos de dolorObjetivosNecesidades de informaciónSectores010k20k30k40k50k60k70k

Anonimización: aplicamos hash a todos los nombres de las personas para convertirlos en Persona_{hash}, eliminamos las historias narrativas y quitamos los UUID internos. El conjunto de datos tiene calidad para investigación y no contiene datos personales.


¿Por qué el 10% y no el 100%?

El conjunto de datos completo de 593,181 personas es nuestro producto comercial. Alimenta la inteligencia de visibilidad en IA para equipos de marketing B2B que necesitan entender cómo los modelos de IA recomiendan su marca, o cómo no la recomiendan.

Publicamos el 10% (15K personas) por tres razones estratégicas:

1. Una muestra para validar. 15,000 personas bastan para reproducir nuestra investigación, validar nuestra metodología y crear herramientas de prueba de concepto. No bastan para reemplazar el conjunto de datos comercial. Si estás entrenando un modelo de recomendación o construyendo un buscador de personas, necesitas las 593K completas.

2. La muestra gratuita que demuestra la calidad. Cada investigador que descarga este conjunto de datos y lo cita en su trabajo valida nuestra metodología. Cada equipo de datos que lo evalúa para licenciarlo comprueba la profundidad del esquema. Esto es generación de demanda con coste de adquisición de clientes cero.

3. La autoridad académica se acumula. Publicar en HuggingFace con un DOI citable significa que otros investigadores hacen referencia a este conjunto de datos. Esas citas refuerzan nuestra posición: si estudias personas generadas por IA, el modelado de la intención de compra o el comportamiento de recomendación de los LLM, este es el conjunto de datos canónico.

Conjunto completo vs subconjunto abierto

593,18114,955Conjunto completo (593K)Subconjunto abierto (15K)0100k200k300k400k500k600k

Compáralo con una campaña de anuncios en LinkedIn de EUR 2,500. HuggingFace nos da leads de mayor calidad, investigadores, científicos de datos, equipos de ML empresariales, con un coste de EUR 0.


Para quién es este conjunto de datos

Investigadores que estudian el comportamiento de la IA, la generación de personas o el modelado de la intención de compra. Este es tu conjunto de entrenamiento para evaluar hasta qué punto los modelos de IA capturan arquetipos de compradores del mundo real.

Científicos de datos que construyen sistemas de recomendación, modelos de relevancia de búsqueda o motores de personalización de contenidos. Úsalo para comprobar si tu modelo puede predecir qué personas se interesan por qué características.

Tecnólogos de marketing que evalúan herramientas como HubSpot, Salesforce Marketing Cloud o SEMrush. Si tu proveedor promete "insights de compra impulsados por IA", ahora puedes comparar sus resultados con un conjunto de datos publicado.

Equipos de producto de plataformas de martech o de inteligencia de ventas. Si estás considerando licenciar el conjunto de datos completo para una integración OEM (EUR 50K-200K/año), esta es tu prueba de valor.

Laboratorios académicos que investigan la equidad, el sesgo o la diversidad de personas en conjuntos de datos generados por IA. El artículo completo incluye un análisis de sesgo por género, edad y representación por sector.


Qué puedes construir con él

Construimos tres herramientas abiertas con este conjunto de datos. Tú también puedes.

1. Persona Matcher Sube el contenido de tu web o las descripciones de tus productos. La herramienta te vincula con las personas del conjunto de datos con las que más conectas, ordenadas por similitud semántica. Piénsalo como un "encuentra a mi audiencia" basado en lo que la IA cree que señala tu contenido.

2. Benchmark Calculator Compara tu cobertura de personas con la de tus pares del sector. Si eres una empresa de SaaS B2B, ¿cómo se compara la diversidad de tu audiencia con la mediana? ¿Estás sobrerrepresentando a los compradores técnicos y dejando fuera a los compradores económicos?

3. AI Perception Readiness Index Puntúa la visibilidad de tu marca en los distintos modelos de IA. El conjunto de datos alimenta la línea base: qué personas están desatendidas por las recomendaciones actuales de la IA y dónde están las brechas estratégicas.

Puedes replicar estas herramientas, mejorarlas o construir algo completamente distinto. El conjunto de datos está bajo licencia Apache 2.0. Atribución requerida, uso comercial permitido.


Qué ofrece el conjunto de datos completo

El conjunto de datos completo de 593,181 personas incluye todo lo del subconjunto de 15K, y además:

  • 40x más cobertura: 593,181 personas en 339 sectores (25 verticales principales) con una estratificación por subsegmentos más profunda
  • Seguimiento longitudinal: la evolución de las personas a lo largo del tiempo, ya que regeneramos el conjunto de datos cada trimestre
  • Historias narrativas: narrativas completas del recorrido del comprador (eliminadas del subconjunto público por anonimización)
  • Contexto competitivo: qué personas prefieren a los competidores, y por qué
  • Acceso por API: consulta las personas por sector, punto de dolor o intención de búsqueda mediante una API REST
  • Licencia OEM: integración de marca blanca en tu producto, con SLA y soporte

El conjunto de datos completo está disponible mediante licencia empresarial (EUR 25K-120K/año) o suscripciones a la API (desde EUR 2,500/mes). Escríbenos a contact@rankfor.ai para conocer precios y obtener acceso de evaluación.


Cómo usar este conjunto de datos

Descárgalo desde HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Cárgalo en Python:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Cita la investigación: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Enlace al artículo]

Explora las herramientas: prueba el Persona Matcher, el Benchmark Calculator o el AI Perception Readiness Index para ver qué puedes construir con datos de personas.


Por qué esto importa para tu marca

Si los asistentes de IA están recomendando soluciones a tus clientes potenciales, necesitas saber:

  1. Qué personas hacen preguntas sobre tu categoría que la IA no sabe responder (brechas de oportunidad)
  2. A qué personas la IA recomienda a tus competidores y no a ti (vulnerabilidad competitiva)
  3. En qué personas estás invirtiendo de más con contenido que la IA ya favorece (esfuerzo desperdiciado)

Este conjunto de datos es la base de ese análisis. El subconjunto de 15K demuestra la metodología. El conjunto de datos completo de 593K alimenta la capa de inteligencia que responde a esas preguntas para tu marca.

Descarga el conjunto de datos. Construye con él. Si necesitas el conjunto de datos comercial completo, estamos a un correo de distancia.


Acerca de Rankfor.AI: ayudamos a los equipos de marketing B2B a entender su visibilidad en IA: qué saben los modelos de IA sobre su marca, a qué personas llegan y dónde dominan los competidores la conversación. Nuestra plataforma está construida sobre el mayor conjunto de datos publicado de buyer personas generadas por IA. Más información en rankfor.ai.

Descarga el conjunto de datos: HuggingFace Explora las herramientas: Persona Matcher | Benchmark Calculator | Readiness Score Licencia el conjunto de datos completo: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Todos los derechos reservados.

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Usamos cookies

Utilizamos cookies esenciales para que nuestro sitio funcione. Con su consentimiento, también podemos usar cookies de análisis para comprender cómo utiliza nuestras herramientas (como el Dice Roller) y así poder mejorarlas. Más información