article

PersonaGen-15K: de eerste open dataset met door AI gegenereerde buyer persona's

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15.000 buyer persona's gepubliceerd op HuggingFace om te valideren wat AI denkt dat uw klanten willen, en waarom we niet alle 593K hebben gepubliceerd.


Waarom we deze dataset hebben gepubliceerd

De meeste datasets met buyer persona's zijn ofwel synthetische ruis, ofwel opgesloten achter enterprise-betaalmuren. We hebben PersonaGen-15K op HuggingFace gepubliceerd om een ander punt te bewijzen: door AI gegenereerde persona's zijn geen hallucinaties, maar een weerspiegeling van wat AI-modellen leren van het web.

Dit is een subset van 15.000 persona's uit onze volledige dataset van 593.181 persona's, een historische steekproef van 10% uit de eerdere versie van 149K, gepubliceerd in Springers tijdschrift Discover Artificial Intelligence. De subset is gestratificeerd per branche, geanonimiseerd en gecomprimeerd tot één Parquet-bestand van 8,9 MB. De volledige dataset is de basis van ons commerciële platform voor AI-visibility-intelligence. Deze subset is het bewijs.

Bent u onderzoeker, data scientist of marketing-technoloog en vraagt u zich af "corresponderen door AI gegenereerde persona's echt met werkelijk koopgedrag?", dan is dit uw validatieset. Overweegt u om de volledige dataset te licentiëren voor uw product of onderzoek, dan is dit uw kwaliteitscontrole.

U kunt de dataset hier downloaden: PersonaGen-15K op HuggingFace.


Wat er in de dataset zit

PersonaGen-15K bevat 14.955 buyer persona's verdeeld over 25 branches, gegenereerd met Google's Gemini 2.0 Flash. Elke persona bevat:

  • Demografie: Leeftijdscategorie, opleiding, functie, bedrijfsgrootte
  • Doelen: Wat ze willen bereiken (zakelijke doelstellingen, persoonlijke uitkomsten)
  • Pijnpunten: Operationele wrijving, budgetbeperkingen, ontbrekende capaciteiten
  • Zoekopdrachten: De vragen die ze stellen aan AI-assistenten en zoekmachines
  • Onontdekte behoeften: Impliciete vereisten die niet in zoekopdrachten worden genoemd, maar via gedragsanalyse aan het licht komen
  • Marktcontext: Branche, concurrentiedruk, regelgevende omgeving
  • Koopmomenten: Gebeurtenissen die hen van onderzoek naar evaluatie doen overgaan

De dataset is opgeslagen in ZSTD-gecomprimeerd Parquet-formaat voor efficiënt inladen in pandas, Polars of DuckDB. De brancheverdeling is behouden tot binnen 0,2% van de oorspronkelijke dataset, wat betekent dat de gestratificeerde steekproef statistisch representatief is.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonimisering: We hebben alle persona-namen gehasht naar Persona_{hash}, de verhalende beschrijvingen verwijderd en interne UUID's weggelaten. De dataset is geschikt voor onderzoek en bevat geen persoonsgegevens.


Waarom 10% en niet 100%?

De volledige dataset van 593.181 persona's is ons commerciële product. Die voedt AI-visibility-intelligence voor B2B-marketingteams die moeten begrijpen hoe AI-modellen hun merk aanbevelen, of juist niet.

We hebben 10% (15K persona's) gepubliceerd om drie strategische redenen:

1. Validatie, geen vervanging. 15.000 persona's is genoeg om ons onderzoek te reproduceren, onze methodologie te valideren en proof-of-concept-tools te bouwen. Het is niet genoeg om de commerciële dataset te vervangen. Traint u een aanbevelingsmodel of bouwt u een zoekmachine voor persona's, dan hebt u de volledige 593K nodig.

2. Het gratis voorbeeld dat de kwaliteit bewijst. Elke onderzoeker die deze dataset downloadt en in zijn werk citeert, valideert onze methodologie. Elk datateam dat de dataset beoordeelt voor licentiëring, ervaart de diepgang van het schema. Dit is demand generation tegen nul acquisitiekosten per klant.

3. Academisch gezag stapelt zich op. Publiceren op HuggingFace met een citeerbare DOI betekent dat andere onderzoekers naar deze dataset verwijzen. Die citaties versterken onze positie: bestudeert u door AI gegenereerde persona's, koopintentiemodellering of het aanbevelingsgedrag van LLM's, dan is dit de canonieke dataset.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Vergelijk dat met een LinkedIn-advertentiecampagne van EUR 2.500. HuggingFace levert ons leads van hogere kwaliteit, denk aan onderzoekers, data scientists en enterprise ML-teams, tegen EUR 0 kosten.


Voor wie deze dataset bedoeld is

Onderzoekers die AI-gedrag, persona-generatie of koopintentiemodellering bestuderen. Dit is uw trainingsset om te beoordelen hoe goed AI-modellen werkelijke koperarchetypen vastleggen.

Data scientists die aanbevelingssystemen, modellen voor zoekrelevantie of engines voor contentpersonalisatie bouwen. Gebruik deze om te testen of uw model kan voorspellen welke persona's om welke features geven.

Marketing-technologen die tools als HubSpot, Salesforce Marketing Cloud of SEMrush beoordelen. Beweert uw leverancier "AI-gedreven koperinzichten" te bieden, dan kunt u hun output nu vergelijken met een gepubliceerde dataset.

Productteams bij martech- of sales-intelligence-platforms. Overweegt u de volledige dataset te licentiëren voor OEM-integratie (EUR 50K-200K/jaar), dan is dit uw proof-of-value.

Academische labs die eerlijkheid, bias of persona-diversiteit in door AI gegenereerde datasets onderzoeken. Het volledige artikel bevat een bias-analyse over gender, leeftijd en branchevertegenwoordiging.


Wat u ermee kunt bouwen

We hebben drie open tools gebouwd met deze dataset. Dat kunt u ook.

1. Persona Matcher Upload uw websitecontent of productbeschrijvingen. De tool koppelt u aan de meest resonerende persona's in de dataset, gerangschikt op semantische gelijkenis. Zie het als "vind mijn doelgroep" op basis van wat AI denkt dat uw content signaleert.

2. Benchmark Calculator Vergelijk uw persona-dekking met branchegenoten. Bent u een B2B-SaaS-bedrijf, hoe verhoudt de diversiteit van uw doelgroep zich dan tot de mediaan? Overweegt u te veel op technische kopers en mist u de economische kopers?

3. AI Perception Readiness Index Scoor de zichtbaarheid van uw merk in AI-modellen. De dataset voedt de basislijn: welke persona's worden onderbediend door de huidige AI-aanbevelingen, en waar liggen de strategische hiaten?

U kunt deze tools nabouwen, verbeteren of iets heel anders bouwen. De dataset valt onder de Apache 2.0-licentie. Naamsvermelding vereist, commercieel gebruik toegestaan.


Wat de volledige dataset biedt

De volledige dataset van 593.181 persona's bevat alles uit de subset van 15K, plus:

  • 40x meer dekking: 593.181 persona's verdeeld over 339 branches (25 primaire verticals) met diepere stratificatie op subsegmentniveau
  • Longitudinale tracking: Persona-evolutie in de tijd, doordat we de dataset elk kwartaal opnieuw genereren
  • Verhalende beschrijvingen: Volledige verhalen over de buyer journey (verwijderd uit de openbare subset voor anonimisering)
  • Concurrentiecontext: Welke persona's de voorkeur geven aan concurrenten, en waarom
  • API-toegang: Persona's opvragen per branche, pijnpunt of zoekintentie via een REST API
  • OEM-licentiëring: White-label-integratie in uw product, met SLA en support

De volledige dataset is beschikbaar via enterprise-licentiëring (EUR 25K-120K/jaar) of API-abonnementen (vanaf EUR 2.500/maand). Neem contact met ons op via contact@rankfor.ai voor prijzen en evaluatietoegang.


Hoe u deze dataset gebruikt

Download de dataset van HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Laad de dataset in Python:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Citeer het onderzoek: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]

Verken de tools: Probeer de Persona Matcher, Benchmark Calculator of AI Perception Readiness Index om te zien wat u kunt bouwen met persona-data.


Waarom dit belangrijk is voor uw merk

Als AI-assistenten oplossingen aanbevelen aan uw potentiële klanten, moet u weten:

  1. Welke persona's vragen stellen over uw categorie die AI niet kan beantwoorden (kansenhiaten)
  2. Welke persona's AI aan uw concurrenten aanbeveelt in plaats van aan u (concurrentiekwetsbaarheid)
  3. In welke persona's u te veel investeert met content die AI toch al bevoordeelt (verspilde moeite)

Deze dataset is de basis van die analyse. De subset van 15K bewijst de methodologie. De volledige dataset van 593K voedt de intelligentielaag die deze vragen voor uw merk beantwoordt.

Download de dataset. Bouw ermee. Hebt u de volledige commerciële dataset nodig, dan zijn we één e-mail verwijderd.


Over Rankfor.AI: Wij helpen B2B-marketingteams hun AI-visibility te begrijpen: wat AI-modellen weten over hun merk, welke persona's ze bereiken en waar concurrenten het gesprek domineren. Ons platform is gebouwd op de grootste gepubliceerde dataset met door AI gegenereerde buyer persona's. Lees meer op rankfor.ai.

Download de dataset: HuggingFace Verken de tools: Persona Matcher | Benchmark Calculator | Readiness Score Licentieer de volledige dataset: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

We gebruiken cookies

We gebruiken essentiële cookies om onze site te laten werken. Met uw toestemming kunnen we ook analytische cookies gebruiken om te begrijpen hoe u onze tools gebruikt (zoals de Dice Roller), zodat we ze kunnen verbeteren. Meer informatie