15.000 købspersonaer udgivet på HuggingFace for at validere, hvad AI tror, dine kunder ønsker, og hvorfor vi ikke udgav alle 593K.
Hvorfor vi udgav dette datasæt
De fleste datasæt med købspersonaer er enten syntetisk støj eller låst bag betalingsmure for virksomheder. Vi udgav PersonaGen-15K på HuggingFace for at bevise en anden pointe: AI-genererede personaer er ikke hallucinationer, de er et spejl af, hvad AI-modeller lærer fra nettet.
Dette er et delsæt på 15.000 personaer fra vores fulde datasæt med 593.181 personaer, en historisk 10 %-stikprøve fra den tidligere 149K-version, udgivet i Springers tidsskrift Discover Artificial Intelligence. Det er stratificeret efter branche, anonymiseret og komprimeret til en enkelt Parquet-fil på 8,9 MB. Det fulde datasæt er fundamentet for vores kommercielle platform til AI-synlighedsintelligens. Dette delsæt er beviset.
Er du forsker, dataforsker eller marketingteknolog, der spørger "kortlægger AI-genererede personaer faktisk reel købsadfærd?", så er dette dit valideringssæt. Overvejer du, om du skal licensere det fulde datasæt til dit produkt eller din forskning, så er dette dit kvalitetstjek.
Du kan downloade det her: PersonaGen-15K på HuggingFace.
Hvad datasættet indeholder
PersonaGen-15K indeholder 14.955 købspersonaer på tværs af 25 brancher, genereret med Googles Gemini 2.0 Flash. Hver persona omfatter:
- Demografi: Aldersinterval, uddannelse, jobfunktion, virksomhedsstørrelse
- Mål: Hvad de forsøger at opnå (forretningsmål, personlige resultater)
- Smertepunkter: Operationel friktion, budgetbegrænsninger, kompetencehuller
- Søgeforespørgsler: De spørgsmål, de stiller til AI-assistenter og søgemaskiner
- Uafdækkede behov: Implicitte krav, der ikke er nævnt i søgninger, men afsløres gennem adfærdsanalyse
- Markedskontekst: Branche, konkurrencepres, regulatoriske rammer
- Købstriggere: Begivenheder, der flytter dem fra research til vurdering
Datasættet er gemt i ZSTD-komprimeret Parquet-format for effektiv indlæsning i pandas, Polars eller DuckDB. Branchefordelingen er bevaret inden for 0,2 % af det oprindelige datasæt, hvilket betyder, at den stratificerede stikprøve er statistisk repræsentativ.
PersonaGen-15K: Dataset Composition
Anonymisering: Vi hashede alle personanavne til Persona_{hash}, fjernede narrative fortællinger og slettede interne UUID'er. Datasættet er af forskningskvalitet, ikke persondata.
Hvorfor 10 % og ikke 100 %?
Det fulde datasæt med 593.181 personaer er vores kommercielle produkt. Det driver AI-synlighedsintelligens for B2B-marketingteams, der har brug for at forstå, hvordan AI-modeller anbefaler deres brand, eller lader være.
Vi udgav 10 % (15K personaer) af tre strategiske grunde:
1. Validering, ikke erstatning. 15.000 personaer er nok til at reproducere vores forskning, validere vores metode og bygge proof-of-concept-værktøjer. Det er ikke nok til at erstatte det kommercielle datasæt. Træner du en anbefalingsmodel eller bygger du en søgemaskine til personaer, har du brug for de fulde 593K.
2. Den gratis prøve, der beviser kvaliteten. Hver forsker, der downloader dette datasæt og citerer det i sit arbejde, validerer vores metode. Hvert datateam, der vurderer det med henblik på licensering, oplever skemaets dybde. Dette er efterspørgselsgenerering med nul omkostninger til kundeanskaffelse.
3. Akademisk autoritet forstærker sig selv. At udgive på HuggingFace med et citerbart DOI betyder, at andre forskere refererer til dette datasæt. De citationer styrker vores position: studerer du AI-genererede personaer, modellering af købsintention eller LLM'ers anbefalingsadfærd, så er dette det kanoniske datasæt.
Full Dataset vs Open Subset
Sammenlign det med en LinkedIn-annoncekampagne til 2.500 EUR. HuggingFace giver os leads af højere kvalitet, forskere, dataforskere, ML-teams i virksomheder, til en pris på 0 EUR.
Hvem dette datasæt er til
Forskere, der studerer AI-adfærd, personagenerering eller modellering af købsintention. Dette er dit træningssæt til at vurdere, hvor godt AI-modeller fanger virkelige købsarketyper.
Dataforskere, der bygger anbefalingssystemer, relevansmodeller til søgning eller motorer til indholdspersonalisering. Brug det til at teste, om din model kan forudsige, hvilke personaer der interesserer sig for hvilke funktioner.
Marketingteknologer, der vurderer værktøjer som HubSpot, Salesforce Marketing Cloud eller SEMrush. Hvis din leverandør påstår "AI-drevet køberindsigt", kan du nu benchmarke deres output mod et udgivet datasæt.
Produktteams hos martech- eller salgsintelligensplatforme. Overvejer du at licensere det fulde datasæt til OEM-integration (50K-200K EUR/år), så er dette dit bevis på værdien.
Akademiske laboratorier, der forsker i retfærdighed, bias eller personamangfoldighed i AI-genererede datasæt. Den fulde artikel omfatter bias-analyse på tværs af køn, alder og branchefordeling.
Hvad du kan bygge med det
Vi byggede tre åbne værktøjer med dette datasæt. Det kan du også.
1. Persona Matcher Upload dit webstedsindhold eller dine produktbeskrivelser. Værktøjet matcher dig med de mest resonante personaer i datasættet, rangeret efter semantisk lighed. Tænk på det som "find mit publikum" baseret på, hvad AI mener, dit indhold signalerer.
2. Benchmark Calculator Sammenlign din personadækning med brancheligestillede. Er du et B2B-SaaS-selskab, hvordan står din publikumsdiversitet så i forhold til medianen? Overindekserer du på tekniske købere og overser de økonomiske?
3. AI Perception Readiness Index Vurder dit brands synlighed på tværs af AI-modeller. Datasættet driver baseline: hvilke personaer bliver underbetjent af de nuværende AI-anbefalinger, og hvor er de strategiske huller?
Du kan replikere disse værktøjer, forbedre dem eller bygge noget helt andet. Datasættet er licenseret under Apache 2.0. Kildeangivelse er påkrævet, kommerciel brug er tilladt.
Hvad det fulde datasæt tilbyder
Det fulde datasæt med 593.181 personaer omfatter alt i 15K-delsættet, plus:
- 40x mere dækning: 593.181 personaer på tværs af 339 brancher (25 primære vertikaler) med dybere stratificering af undersegmenter
- Longitudinel sporing: Personaernes udvikling over tid, efterhånden som vi regenererer datasættet kvartalsvis
- Narrative fortællinger: Fulde fortællinger om købsrejsen (fjernet fra det offentlige delsæt af hensyn til anonymisering)
- Konkurrencekontekst: Hvilke personaer der foretrækker konkurrenter, og hvorfor
- API-adgang: Forespørg personaer efter branche, smertepunkt eller søgeintention via REST API
- OEM-licensering: White-label-integration i dit produkt, med SLA og support
Det fulde datasæt er tilgængeligt via virksomhedslicensering (25K-120K EUR/år) eller API-abonnementer (fra 2.500 EUR/måned). Kontakt os på contact@rankfor.ai for priser og adgang til evaluering.
Sådan bruger du dette datasæt
Download det fra HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K
Indlæs det i Python:
import pandas as pd
df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())
Citér forskningen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link til artikel]
Udforsk værktøjerne: Prøv Persona Matcher, Benchmark Calculator eller AI Perception Readiness Index for at se, hvad du kan bygge med personadata.
Hvorfor dette betyder noget for dit brand
Hvis AI-assistenter anbefaler løsninger til dine potentielle kunder, har du brug for at vide:
- Hvilke personaer stiller spørgsmål, som AI ikke kan besvare om din kategori (mulighedshuller)
- Hvilke personaer anbefaler AI til dine konkurrenter i stedet for dig (konkurrencemæssig sårbarhed)
- Hvilke personaer overinvesterer du i med indhold, som AI allerede favoriserer (spildt indsats)
Dette datasæt er fundamentet for den analyse. 15K-delsættet beviser metoden. Det fulde datasæt med 593K driver det intelligenslag, der besvarer de spørgsmål for dit brand.
Download datasættet. Byg med det. Har du brug for det fulde kommercielle datasæt, er vi kun én e-mail væk.
Om Rankfor.AI: Vi hjælper B2B-marketingteams med at forstå deres AI-synlighed: hvad AI-modeller ved om deres brand, hvilke personaer de når, og hvor konkurrenterne dominerer samtalen. Vores platform er bygget på det største udgivne datasæt af AI-genererede købspersonaer. Læs mere på rankfor.ai.
Download datasættet: HuggingFace Udforsk værktøjerne: Persona Matcher | Benchmark Calculator | Readiness Score Licensér det fulde datasæt: contact@rankfor.ai
