OpenRankfor.AI
article

PersonaGen-15K : le premier jeu de données ouvert de buyer personas générés par IA

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15 000 buyer personas publiés sur HuggingFace pour valider ce que l'IA pense que veulent vos clients, et pourquoi nous n'avons pas publié la totalité des 593 000.


Pourquoi nous avons publié ce jeu de données

La plupart des jeux de données de buyer personas relèvent du bruit synthétique ou restent enfermés derrière des barrières tarifaires réservées aux entreprises. Nous avons publié PersonaGen-15K sur HuggingFace pour démontrer autre chose : les personas générés par IA ne sont pas des hallucinations, ils reflètent ce que les modèles d'IA apprennent du web.

Il s'agit d'un sous-ensemble de 15 000 personas issu de notre jeu de données complet de 593 181 personas, un échantillon historique de 10 % tiré de la version antérieure à 149 000, publié dans la revue Discover Artificial Intelligence de Springer. Il est stratifié par secteur, anonymisé et compressé dans un unique fichier Parquet de 8,9 Mo. Le jeu de données complet constitue le socle de notre plateforme commerciale d'intelligence de visibilité IA. Ce sous-ensemble en est la preuve.

Si vous êtes chercheur, data scientist ou spécialiste des technologies marketing et que vous vous demandez « les personas générés par IA correspondent-ils réellement au comportement des acheteurs ? », voici votre jeu de validation. Si vous évaluez l'opportunité de licencier le jeu de données complet pour votre produit ou votre recherche, voici votre contrôle qualité.

Vous pouvez le télécharger ici : PersonaGen-15K sur HuggingFace.


Ce que contient le jeu de données

PersonaGen-15K contient 14 955 buyer personas répartis sur 25 secteurs, générés à l'aide de Gemini 2.0 Flash de Google. Chaque persona comprend :

  • Données démographiques : tranche d'âge, formation, fonction, taille de l'entreprise
  • Objectifs : ce qu'ils cherchent à accomplir (objectifs métier, résultats personnels)
  • Points de friction : frictions opérationnelles, contraintes budgétaires, lacunes de capacités
  • Requêtes de recherche : les questions qu'ils posent aux assistants IA et aux moteurs de recherche
  • Besoins latents : exigences implicites non formulées dans les recherches mais révélées par l'analyse comportementale
  • Contexte de marché : secteur, pressions concurrentielles, environnement réglementaire
  • Déclencheurs d'achat : événements qui les font passer de la recherche à l'évaluation

Le jeu de données est stocké au format Parquet compressé en ZSTD pour un chargement efficace dans pandas, Polars ou DuckDB. La répartition sectorielle est préservée à 0,2 % près du jeu de données d'origine, ce qui signifie que l'échantillon stratifié est statistiquement représentatif.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonymisation : nous avons haché tous les noms de personas en Persona_{hash}, supprimé les récits narratifs et retiré les UUID internes. Le jeu de données est de qualité recherche, sans données personnelles.


Pourquoi 10 %, et non 100 % ?

Le jeu de données complet de 593 181 personas est notre produit commercial. Il alimente l'intelligence de visibilité IA destinée aux équipes marketing B2B qui doivent comprendre comment les modèles d'IA recommandent leur marque, ou ne la recommandent pas.

Nous avons publié 10 % (15 000 personas) pour trois raisons stratégiques :

1. Une validation, pas un remplacement. 15 000 personas suffisent pour reproduire notre recherche, valider notre méthodologie et construire des outils de démonstration. C'est insuffisant pour remplacer le jeu de données commercial. Si vous entraînez un modèle de recommandation ou construisez un moteur de recherche de personas, il vous faut les 593 000 complets.

2. L'échantillon gratuit qui prouve la qualité. Chaque chercheur qui télécharge ce jeu de données et le cite dans ses travaux valide notre méthodologie. Chaque équipe data qui l'évalue en vue d'une licence en découvre la profondeur du schéma. Voici de la génération de demande à coût d'acquisition client nul.

3. L'autorité académique se cumule. Publier sur HuggingFace avec un DOI citable signifie que d'autres chercheurs référencent ce jeu de données. Ces citations renforcent notre position : si vous étudiez les personas générés par IA, la modélisation de l'intention d'achat ou le comportement de recommandation des LLM, voici le jeu de données de référence.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Comparez cela à une campagne publicitaire LinkedIn à 2 500 EUR. HuggingFace nous apporte des leads de meilleure qualité, chercheurs, data scientists, équipes ML d'entreprise, pour un coût de 0 EUR.


À qui s'adresse ce jeu de données

Les chercheurs qui étudient le comportement de l'IA, la génération de personas ou la modélisation de l'intention d'achat. Voici votre jeu d'entraînement pour évaluer dans quelle mesure les modèles d'IA captent les archétypes d'acheteurs réels.

Les data scientists qui construisent des systèmes de recommandation, des modèles de pertinence de recherche ou des moteurs de personnalisation de contenu. Utilisez-le pour tester si votre modèle sait prédire quels personas s'intéressent à quelles fonctionnalités.

Les spécialistes des technologies marketing qui évaluent des outils comme HubSpot, Salesforce Marketing Cloud ou SEMrush. Si votre fournisseur revendique des « insights acheteurs propulsés par l'IA », vous pouvez désormais comparer ses résultats à un jeu de données publié.

Les équipes produit des plateformes martech ou de sales intelligence. Si vous envisagez de licencier le jeu de données complet pour une intégration OEM (50 000 à 200 000 EUR/an), voici votre preuve de valeur.

Les laboratoires universitaires qui étudient l'équité, les biais ou la diversité des personas dans les jeux de données générés par IA. L'article complet inclut une analyse des biais selon le genre, l'âge et la représentation sectorielle.


Ce que vous pouvez construire avec

Nous avons construit trois outils ouverts à partir de ce jeu de données. Vous pouvez en faire autant.

1. Persona Matcher Chargez le contenu de votre site ou vos descriptions de produits. L'outil vous associe aux personas les plus pertinents du jeu de données, classés par similarité sémantique. Voyez-le comme un « trouve mon audience » fondé sur ce que l'IA perçoit des signaux de votre contenu.

2. Benchmark Calculator Comparez votre couverture de personas à celle de vos pairs sectoriels. Si vous êtes une entreprise SaaS B2B, comment la diversité de votre audience se situe-t-elle par rapport à la médiane ? Surinvestissez-vous dans les acheteurs techniques au détriment des acheteurs économiques ?

3. AI Perception Readiness Index Évaluez la visibilité de votre marque à travers les modèles d'IA. Le jeu de données fournit la base de référence : quels personas sont mal servis par les recommandations actuelles de l'IA, et où se trouvent les écarts stratégiques ?

Vous pouvez reproduire ces outils, les améliorer ou construire tout autre chose. Le jeu de données est sous licence Apache 2.0. Attribution requise, usage commercial autorisé.


Ce qu'offre le jeu de données complet

Le jeu de données complet de 593 181 personas inclut tout ce que contient le sous-ensemble de 15 000, plus :

  • Une couverture 40 fois plus large : 593 181 personas répartis sur 339 secteurs (25 verticales principales) avec une stratification plus fine des sous-segments
  • Un suivi longitudinal : l'évolution des personas dans le temps, à mesure que nous régénérons le jeu de données chaque trimestre
  • Des récits narratifs : des parcours d'achat complets (retirés du sous-ensemble public à des fins d'anonymisation)
  • Le contexte concurrentiel : quels personas préfèrent les concurrents, et pourquoi
  • Un accès API : interrogez les personas par secteur, point de friction ou intention de recherche via une API REST
  • Une licence OEM : intégration en marque blanche dans votre produit, avec SLA et support

Le jeu de données complet est disponible via une licence entreprise (25 000 à 120 000 EUR/an) ou des abonnements API (à partir de 2 500 EUR/mois). Contactez-nous à contact@rankfor.ai pour connaître les tarifs et obtenir un accès d'évaluation.


Comment utiliser ce jeu de données

Téléchargez-le depuis HuggingFace : https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Chargez-le en Python :

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Citez la recherche : Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Lien vers l'article]

Explorez les outils : essayez le Persona Matcher, le Benchmark Calculator ou l'AI Perception Readiness Index pour voir ce que vous pouvez construire avec des données de personas.


Pourquoi cela compte pour votre marque

Si les assistants IA recommandent des solutions à vos clients potentiels, vous devez savoir :

  1. Quels personas posent des questions auxquelles l'IA ne sait pas répondre au sujet de votre catégorie (écarts d'opportunité)
  2. Quels personas l'IA recommande à vos concurrents plutôt qu'à vous (vulnérabilité concurrentielle)
  3. Quels personas vous sur-sollicitez avec du contenu que l'IA privilégie déjà (effort gaspillé)

Ce jeu de données est le socle de cette analyse. Le sous-ensemble de 15 000 prouve la méthodologie. Le jeu de données complet de 593 000 alimente la couche d'intelligence qui répond à ces questions pour votre marque.

Téléchargez le jeu de données. Construisez avec. Si vous avez besoin du jeu de données commercial complet, un e-mail suffit.


À propos de Rankfor.AI : nous aidons les équipes marketing B2B à comprendre leur visibilité IA, ce que les modèles d'IA savent de leur marque, quels personas ils atteignent et où les concurrents dominent la conversation. Notre plateforme repose sur le plus grand jeu de données publié de buyer personas générés par IA. En savoir plus sur rankfor.ai.

Téléchargez le jeu de données : HuggingFace Explorez les outils : Persona Matcher | Benchmark Calculator | Readiness Score Licenciez le jeu de données complet : contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

Nous utilisons des cookies

Nous utilisons des cookies essentiels pour faire fonctionner notre site. Avec votre consentement, nous pouvons également utiliser des cookies analytiques pour comprendre comment vous utilisez nos outils (comme le Dice Roller) afin de les améliorer. En savoir plus