15.000 buyer persona's gepubliceerd op HuggingFace om te valideren wat AI denkt dat uw klanten willen, en waarom we niet alle 593K hebben gepubliceerd.
Waarom we deze dataset hebben gepubliceerd
De meeste datasets met buyer persona's zijn ofwel synthetische ruis, ofwel opgesloten achter enterprise-betaalmuren. We hebben PersonaGen-15K op HuggingFace gepubliceerd om een ander punt te bewijzen: door AI gegenereerde persona's zijn geen hallucinaties, maar een weerspiegeling van wat AI-modellen leren van het web.
Dit is een subset van 15.000 persona's uit onze volledige dataset van 593.181 persona's, een historische steekproef van 10% uit de eerdere versie van 149K, gepubliceerd in Springers tijdschrift Discover Artificial Intelligence. De subset is gestratificeerd per branche, geanonimiseerd en gecomprimeerd tot één Parquet-bestand van 8,9 MB. De volledige dataset is de basis van ons commerciële platform voor AI-visibility-intelligence. Deze subset is het bewijs.
Bent u onderzoeker, data scientist of marketing-technoloog en vraagt u zich af "corresponderen door AI gegenereerde persona's echt met werkelijk koopgedrag?", dan is dit uw validatieset. Overweegt u om de volledige dataset te licentiëren voor uw product of onderzoek, dan is dit uw kwaliteitscontrole.
U kunt de dataset hier downloaden: PersonaGen-15K op HuggingFace.
Wat er in de dataset zit
PersonaGen-15K bevat 14.955 buyer persona's verdeeld over 25 branches, gegenereerd met Google's Gemini 2.0 Flash. Elke persona bevat:
- Demografie: Leeftijdscategorie, opleiding, functie, bedrijfsgrootte
- Doelen: Wat ze willen bereiken (zakelijke doelstellingen, persoonlijke uitkomsten)
- Pijnpunten: Operationele wrijving, budgetbeperkingen, ontbrekende capaciteiten
- Zoekopdrachten: De vragen die ze stellen aan AI-assistenten en zoekmachines
- Onontdekte behoeften: Impliciete vereisten die niet in zoekopdrachten worden genoemd, maar via gedragsanalyse aan het licht komen
- Marktcontext: Branche, concurrentiedruk, regelgevende omgeving
- Koopmomenten: Gebeurtenissen die hen van onderzoek naar evaluatie doen overgaan
De dataset is opgeslagen in ZSTD-gecomprimeerd Parquet-formaat voor efficiënt inladen in pandas, Polars of DuckDB. De brancheverdeling is behouden tot binnen 0,2% van de oorspronkelijke dataset, wat betekent dat de gestratificeerde steekproef statistisch representatief is.
PersonaGen-15K: Dataset Composition
Anonimisering: We hebben alle persona-namen gehasht naar Persona_{hash}, de verhalende beschrijvingen verwijderd en interne UUID's weggelaten. De dataset is geschikt voor onderzoek en bevat geen persoonsgegevens.
Waarom 10% en niet 100%?
De volledige dataset van 593.181 persona's is ons commerciële product. Die voedt AI-visibility-intelligence voor B2B-marketingteams die moeten begrijpen hoe AI-modellen hun merk aanbevelen, of juist niet.
We hebben 10% (15K persona's) gepubliceerd om drie strategische redenen:
1. Validatie, geen vervanging. 15.000 persona's is genoeg om ons onderzoek te reproduceren, onze methodologie te valideren en proof-of-concept-tools te bouwen. Het is niet genoeg om de commerciële dataset te vervangen. Traint u een aanbevelingsmodel of bouwt u een zoekmachine voor persona's, dan hebt u de volledige 593K nodig.
2. Het gratis voorbeeld dat de kwaliteit bewijst. Elke onderzoeker die deze dataset downloadt en in zijn werk citeert, valideert onze methodologie. Elk datateam dat de dataset beoordeelt voor licentiëring, ervaart de diepgang van het schema. Dit is demand generation tegen nul acquisitiekosten per klant.
3. Academisch gezag stapelt zich op. Publiceren op HuggingFace met een citeerbare DOI betekent dat andere onderzoekers naar deze dataset verwijzen. Die citaties versterken onze positie: bestudeert u door AI gegenereerde persona's, koopintentiemodellering of het aanbevelingsgedrag van LLM's, dan is dit de canonieke dataset.
Full Dataset vs Open Subset
Vergelijk dat met een LinkedIn-advertentiecampagne van EUR 2.500. HuggingFace levert ons leads van hogere kwaliteit, denk aan onderzoekers, data scientists en enterprise ML-teams, tegen EUR 0 kosten.
Voor wie deze dataset bedoeld is
Onderzoekers die AI-gedrag, persona-generatie of koopintentiemodellering bestuderen. Dit is uw trainingsset om te beoordelen hoe goed AI-modellen werkelijke koperarchetypen vastleggen.
Data scientists die aanbevelingssystemen, modellen voor zoekrelevantie of engines voor contentpersonalisatie bouwen. Gebruik deze om te testen of uw model kan voorspellen welke persona's om welke features geven.
Marketing-technologen die tools als HubSpot, Salesforce Marketing Cloud of SEMrush beoordelen. Beweert uw leverancier "AI-gedreven koperinzichten" te bieden, dan kunt u hun output nu vergelijken met een gepubliceerde dataset.
Productteams bij martech- of sales-intelligence-platforms. Overweegt u de volledige dataset te licentiëren voor OEM-integratie (EUR 50K-200K/jaar), dan is dit uw proof-of-value.
Academische labs die eerlijkheid, bias of persona-diversiteit in door AI gegenereerde datasets onderzoeken. Het volledige artikel bevat een bias-analyse over gender, leeftijd en branchevertegenwoordiging.
Wat u ermee kunt bouwen
We hebben drie open tools gebouwd met deze dataset. Dat kunt u ook.
1. Persona Matcher Upload uw websitecontent of productbeschrijvingen. De tool koppelt u aan de meest resonerende persona's in de dataset, gerangschikt op semantische gelijkenis. Zie het als "vind mijn doelgroep" op basis van wat AI denkt dat uw content signaleert.
2. Benchmark Calculator Vergelijk uw persona-dekking met branchegenoten. Bent u een B2B-SaaS-bedrijf, hoe verhoudt de diversiteit van uw doelgroep zich dan tot de mediaan? Overweegt u te veel op technische kopers en mist u de economische kopers?
3. AI Perception Readiness Index Scoor de zichtbaarheid van uw merk in AI-modellen. De dataset voedt de basislijn: welke persona's worden onderbediend door de huidige AI-aanbevelingen, en waar liggen de strategische hiaten?
U kunt deze tools nabouwen, verbeteren of iets heel anders bouwen. De dataset valt onder de Apache 2.0-licentie. Naamsvermelding vereist, commercieel gebruik toegestaan.
Wat de volledige dataset biedt
De volledige dataset van 593.181 persona's bevat alles uit de subset van 15K, plus:
- 40x meer dekking: 593.181 persona's verdeeld over 339 branches (25 primaire verticals) met diepere stratificatie op subsegmentniveau
- Longitudinale tracking: Persona-evolutie in de tijd, doordat we de dataset elk kwartaal opnieuw genereren
- Verhalende beschrijvingen: Volledige verhalen over de buyer journey (verwijderd uit de openbare subset voor anonimisering)
- Concurrentiecontext: Welke persona's de voorkeur geven aan concurrenten, en waarom
- API-toegang: Persona's opvragen per branche, pijnpunt of zoekintentie via een REST API
- OEM-licentiëring: White-label-integratie in uw product, met SLA en support
De volledige dataset is beschikbaar via enterprise-licentiëring (EUR 25K-120K/jaar) of API-abonnementen (vanaf EUR 2.500/maand). Neem contact met ons op via contact@rankfor.ai voor prijzen en evaluatietoegang.
Hoe u deze dataset gebruikt
Download de dataset van HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K
Laad de dataset in Python:
import pandas as pd
df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())
Citeer het onderzoek: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]
Verken de tools: Probeer de Persona Matcher, Benchmark Calculator of AI Perception Readiness Index om te zien wat u kunt bouwen met persona-data.
Waarom dit belangrijk is voor uw merk
Als AI-assistenten oplossingen aanbevelen aan uw potentiële klanten, moet u weten:
- Welke persona's vragen stellen over uw categorie die AI niet kan beantwoorden (kansenhiaten)
- Welke persona's AI aan uw concurrenten aanbeveelt in plaats van aan u (concurrentiekwetsbaarheid)
- In welke persona's u te veel investeert met content die AI toch al bevoordeelt (verspilde moeite)
Deze dataset is de basis van die analyse. De subset van 15K bewijst de methodologie. De volledige dataset van 593K voedt de intelligentielaag die deze vragen voor uw merk beantwoordt.
Download de dataset. Bouw ermee. Hebt u de volledige commerciële dataset nodig, dan zijn we één e-mail verwijderd.
Over Rankfor.AI: Wij helpen B2B-marketingteams hun AI-visibility te begrijpen: wat AI-modellen weten over hun merk, welke persona's ze bereiken en waar concurrenten het gesprek domineren. Ons platform is gebouwd op de grootste gepubliceerde dataset met door AI gegenereerde buyer persona's. Lees meer op rankfor.ai.
Download de dataset: HuggingFace Verken de tools: Persona Matcher | Benchmark Calculator | Readiness Score Licentieer de volledige dataset: contact@rankfor.ai
