OpenRankfor.AI
article

PersonaGen-15K: Det første åbne datasæt af AI-genererede købspersonaer

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15.000 købspersonaer udgivet på HuggingFace for at validere, hvad AI tror, dine kunder ønsker, og hvorfor vi ikke udgav alle 593K.


Hvorfor vi udgav dette datasæt

De fleste datasæt med købspersonaer er enten syntetisk støj eller låst bag betalingsmure for virksomheder. Vi udgav PersonaGen-15K på HuggingFace for at bevise en anden pointe: AI-genererede personaer er ikke hallucinationer, de er et spejl af, hvad AI-modeller lærer fra nettet.

Dette er et delsæt på 15.000 personaer fra vores fulde datasæt med 593.181 personaer, en historisk 10 %-stikprøve fra den tidligere 149K-version, udgivet i Springers tidsskrift Discover Artificial Intelligence. Det er stratificeret efter branche, anonymiseret og komprimeret til en enkelt Parquet-fil på 8,9 MB. Det fulde datasæt er fundamentet for vores kommercielle platform til AI-synlighedsintelligens. Dette delsæt er beviset.

Er du forsker, dataforsker eller marketingteknolog, der spørger "kortlægger AI-genererede personaer faktisk reel købsadfærd?", så er dette dit valideringssæt. Overvejer du, om du skal licensere det fulde datasæt til dit produkt eller din forskning, så er dette dit kvalitetstjek.

Du kan downloade det her: PersonaGen-15K på HuggingFace.


Hvad datasættet indeholder

PersonaGen-15K indeholder 14.955 købspersonaer på tværs af 25 brancher, genereret med Googles Gemini 2.0 Flash. Hver persona omfatter:

  • Demografi: Aldersinterval, uddannelse, jobfunktion, virksomhedsstørrelse
  • Mål: Hvad de forsøger at opnå (forretningsmål, personlige resultater)
  • Smertepunkter: Operationel friktion, budgetbegrænsninger, kompetencehuller
  • Søgeforespørgsler: De spørgsmål, de stiller til AI-assistenter og søgemaskiner
  • Uafdækkede behov: Implicitte krav, der ikke er nævnt i søgninger, men afsløres gennem adfærdsanalyse
  • Markedskontekst: Branche, konkurrencepres, regulatoriske rammer
  • Købstriggere: Begivenheder, der flytter dem fra research til vurdering

Datasættet er gemt i ZSTD-komprimeret Parquet-format for effektiv indlæsning i pandas, Polars eller DuckDB. Branchefordelingen er bevaret inden for 0,2 % af det oprindelige datasæt, hvilket betyder, at den stratificerede stikprøve er statistisk repræsentativ.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonymisering: Vi hashede alle personanavne til Persona_{hash}, fjernede narrative fortællinger og slettede interne UUID'er. Datasættet er af forskningskvalitet, ikke persondata.


Hvorfor 10 % og ikke 100 %?

Det fulde datasæt med 593.181 personaer er vores kommercielle produkt. Det driver AI-synlighedsintelligens for B2B-marketingteams, der har brug for at forstå, hvordan AI-modeller anbefaler deres brand, eller lader være.

Vi udgav 10 % (15K personaer) af tre strategiske grunde:

1. Validering, ikke erstatning. 15.000 personaer er nok til at reproducere vores forskning, validere vores metode og bygge proof-of-concept-værktøjer. Det er ikke nok til at erstatte det kommercielle datasæt. Træner du en anbefalingsmodel eller bygger du en søgemaskine til personaer, har du brug for de fulde 593K.

2. Den gratis prøve, der beviser kvaliteten. Hver forsker, der downloader dette datasæt og citerer det i sit arbejde, validerer vores metode. Hvert datateam, der vurderer det med henblik på licensering, oplever skemaets dybde. Dette er efterspørgselsgenerering med nul omkostninger til kundeanskaffelse.

3. Akademisk autoritet forstærker sig selv. At udgive på HuggingFace med et citerbart DOI betyder, at andre forskere refererer til dette datasæt. De citationer styrker vores position: studerer du AI-genererede personaer, modellering af købsintention eller LLM'ers anbefalingsadfærd, så er dette det kanoniske datasæt.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Sammenlign det med en LinkedIn-annoncekampagne til 2.500 EUR. HuggingFace giver os leads af højere kvalitet, forskere, dataforskere, ML-teams i virksomheder, til en pris på 0 EUR.


Hvem dette datasæt er til

Forskere, der studerer AI-adfærd, personagenerering eller modellering af købsintention. Dette er dit træningssæt til at vurdere, hvor godt AI-modeller fanger virkelige købsarketyper.

Dataforskere, der bygger anbefalingssystemer, relevansmodeller til søgning eller motorer til indholdspersonalisering. Brug det til at teste, om din model kan forudsige, hvilke personaer der interesserer sig for hvilke funktioner.

Marketingteknologer, der vurderer værktøjer som HubSpot, Salesforce Marketing Cloud eller SEMrush. Hvis din leverandør påstår "AI-drevet køberindsigt", kan du nu benchmarke deres output mod et udgivet datasæt.

Produktteams hos martech- eller salgsintelligensplatforme. Overvejer du at licensere det fulde datasæt til OEM-integration (50K-200K EUR/år), så er dette dit bevis på værdien.

Akademiske laboratorier, der forsker i retfærdighed, bias eller personamangfoldighed i AI-genererede datasæt. Den fulde artikel omfatter bias-analyse på tværs af køn, alder og branchefordeling.


Hvad du kan bygge med det

Vi byggede tre åbne værktøjer med dette datasæt. Det kan du også.

1. Persona Matcher Upload dit webstedsindhold eller dine produktbeskrivelser. Værktøjet matcher dig med de mest resonante personaer i datasættet, rangeret efter semantisk lighed. Tænk på det som "find mit publikum" baseret på, hvad AI mener, dit indhold signalerer.

2. Benchmark Calculator Sammenlign din personadækning med brancheligestillede. Er du et B2B-SaaS-selskab, hvordan står din publikumsdiversitet så i forhold til medianen? Overindekserer du på tekniske købere og overser de økonomiske?

3. AI Perception Readiness Index Vurder dit brands synlighed på tværs af AI-modeller. Datasættet driver baseline: hvilke personaer bliver underbetjent af de nuværende AI-anbefalinger, og hvor er de strategiske huller?

Du kan replikere disse værktøjer, forbedre dem eller bygge noget helt andet. Datasættet er licenseret under Apache 2.0. Kildeangivelse er påkrævet, kommerciel brug er tilladt.


Hvad det fulde datasæt tilbyder

Det fulde datasæt med 593.181 personaer omfatter alt i 15K-delsættet, plus:

  • 40x mere dækning: 593.181 personaer på tværs af 339 brancher (25 primære vertikaler) med dybere stratificering af undersegmenter
  • Longitudinel sporing: Personaernes udvikling over tid, efterhånden som vi regenererer datasættet kvartalsvis
  • Narrative fortællinger: Fulde fortællinger om købsrejsen (fjernet fra det offentlige delsæt af hensyn til anonymisering)
  • Konkurrencekontekst: Hvilke personaer der foretrækker konkurrenter, og hvorfor
  • API-adgang: Forespørg personaer efter branche, smertepunkt eller søgeintention via REST API
  • OEM-licensering: White-label-integration i dit produkt, med SLA og support

Det fulde datasæt er tilgængeligt via virksomhedslicensering (25K-120K EUR/år) eller API-abonnementer (fra 2.500 EUR/måned). Kontakt os på contact@rankfor.ai for priser og adgang til evaluering.


Sådan bruger du dette datasæt

Download det fra HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Indlæs det i Python:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Citér forskningen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link til artikel]

Udforsk værktøjerne: Prøv Persona Matcher, Benchmark Calculator eller AI Perception Readiness Index for at se, hvad du kan bygge med personadata.


Hvorfor dette betyder noget for dit brand

Hvis AI-assistenter anbefaler løsninger til dine potentielle kunder, har du brug for at vide:

  1. Hvilke personaer stiller spørgsmål, som AI ikke kan besvare om din kategori (mulighedshuller)
  2. Hvilke personaer anbefaler AI til dine konkurrenter i stedet for dig (konkurrencemæssig sårbarhed)
  3. Hvilke personaer overinvesterer du i med indhold, som AI allerede favoriserer (spildt indsats)

Dette datasæt er fundamentet for den analyse. 15K-delsættet beviser metoden. Det fulde datasæt med 593K driver det intelligenslag, der besvarer de spørgsmål for dit brand.

Download datasættet. Byg med det. Har du brug for det fulde kommercielle datasæt, er vi kun én e-mail væk.


Om Rankfor.AI: Vi hjælper B2B-marketingteams med at forstå deres AI-synlighed: hvad AI-modeller ved om deres brand, hvilke personaer de når, og hvor konkurrenterne dominerer samtalen. Vores platform er bygget på det største udgivne datasæt af AI-genererede købspersonaer. Læs mere på rankfor.ai.

Download datasættet: HuggingFace Udforsk værktøjerne: Persona Matcher | Benchmark Calculator | Readiness Score Licensér det fulde datasæt: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Alle rettigheder forbeholdes

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Vi bruger cookies

Vi bruger essentielle cookies for at få vores site til at fungere. Med dit samtykke kan vi også bruge analytiske cookies for at forstå, hvordan du bruger vores værktøjer (som Dice Roller), så vi kan forbedre dem. Lær mere