article

PersonaGen-15K: Det första öppna datasetet med AI-genererade köparpersonas

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15,000 köparpersonas publicerade på HuggingFace för att validera vad AI tror att dina kunder vill ha, och varför vi inte publicerade alla 593K.


Därför publicerade vi det här datasetet

De flesta dataset med köparpersonas är antingen syntetiskt brus eller inlåsta bakom betalväggar för företag. Vi publicerade PersonaGen-15K på HuggingFace för att bevisa något annat: AI-genererade personas är inga hallucinationer, de speglar vad AI-modeller lär sig från webben.

Det här är en delmängd på 15,000 personas ur vårt fullständiga dataset med 593,181 personas, ett historiskt urval på 10% från den tidigare versionen med 149K, publicerat i Springers tidskrift Discover Artificial Intelligence. Det är stratifierat efter bransch, anonymiserat och komprimerat till en enda Parquet-fil på 8.9 MB. Det fullständiga datasetet är grunden för vår kommersiella plattform för AI-synlighetsintelligens. Den här delmängden är beviset.

Om du är forskare, dataforskare eller marknadsteknolog och undrar "mappar AI-genererade personas verkligen mot verkligt köpbeteende?", då är det här ditt valideringsset. Om du överväger att licensiera det fullständiga datasetet för din produkt eller forskning, är det här din kvalitetskontroll.

Du kan ladda ner det här: PersonaGen-15K på HuggingFace.


Vad datasetet innehåller

PersonaGen-15K innehåller 14,955 köparpersonas fördelade på 25 branscher, genererade med Googles Gemini 2.0 Flash. Varje persona innehåller:

  • Demografi: Åldersintervall, utbildning, jobbfunktion, företagsstorlek
  • Mål: Vad de försöker uppnå (affärsmål, personliga resultat)
  • Smärtpunkter: Operativ friktion, budgetbegränsningar, kapacitetsluckor
  • Sökfrågor: Frågorna de ställer till AI-assistenter och sökmotorer
  • Oupptäckta behov: Underförstådda krav som inte uttrycks i sökningar men avslöjas genom beteendeanalys
  • Marknadskontext: Bransch, konkurrenstryck, regelverk
  • Köputlösare: Händelser som får dem att gå från research till utvärdering

Datasetet lagras i ZSTD-komprimerat Parquet-format för effektiv inläsning i pandas, Polars eller DuckDB. Branschfördelningen bevaras inom 0.2% av det ursprungliga datasetet, vilket innebär att det stratifierade urvalet är statistiskt representativt.

PersonaGen-15K: Datasetets sammansättning

14,95574,40044,90045,00074,10025PersonasSökfrågorSmärtpunkterMålInformationsbehovBranscher010k20k30k40k50k60k70k

Anonymisering: Vi hashade alla persona-namn till Persona_{hash}, tog bort narrativa berättelser och avlägsnade interna UUID:er. Datasetet håller forskningskvalitet och innehåller inga personuppgifter.


Varför 10%, inte 100%?

Det fullständiga datasetet med 593,181 personas är vår kommersiella produkt. Det driver AI-synlighetsintelligens för B2B-marknadsteam som behöver förstå hur AI-modeller rekommenderar deras varumärke, eller inte gör det.

Vi publicerade 10% (15K personas) av tre strategiska skäl:

1. Validering, inte ersättning. 15,000 personas räcker för att reproducera vår forskning, validera vår metodik och bygga proof-of-concept-verktyg. Det räcker inte för att ersätta det kommersiella datasetet. Om du tränar en rekommendationsmodell eller bygger en sökmotor för personas behöver du hela 593K.

2. Gratisprovet som bevisar kvaliteten. Varje forskare som laddar ner det här datasetet och citerar det i sitt arbete validerar vår metodik. Varje datateam som utvärderar det för licensiering upplever schemats djup. Det här är efterfrågegenerering till noll kostnad för kundanskaffning.

3. Akademisk auktoritet växer med tiden. Att publicera på HuggingFace med en citerbar DOI innebär att andra forskare refererar till det här datasetet. Dessa citeringar stärker vår position: om du studerar AI-genererade personas, modellering av köpintention eller LLM-rekommendationsbeteende är det här det kanoniska datasetet.

Fullständigt dataset vs öppen delmängd

593,18114,955Fullständigt dataset (593K)Öppen delmängd (15K)0100k200k300k400k500k600k

Jämför det med en LinkedIn-annonskampanj för EUR 2,500. HuggingFace ger oss leads av högre kvalitet, forskare, dataforskare, ML-team på företag, till en kostnad av EUR 0.


Vem det här datasetet är för

Forskare som studerar AI-beteende, personagenerering eller modellering av köpintention. Det här är ditt träningsset för att utvärdera hur väl AI-modeller fångar verkliga köparearketyper.

Dataforskare som bygger rekommendationssystem, modeller för sökrelevans eller motorer för innehållspersonalisering. Använd det för att testa om din modell kan förutsäga vilka personas som bryr sig om vilka funktioner.

Marknadsteknologer som utvärderar verktyg som HubSpot, Salesforce Marketing Cloud eller SEMrush. Om din leverantör hävdar "AI-drivna köparinsikter" kan du nu jämföra deras resultat mot ett publicerat dataset.

Produktteam på martech- eller sales intelligence-plattformar. Om du överväger att licensiera det fullständiga datasetet för OEM-integration (EUR 50K-200K/år) är det här ditt bevis på värde.

Akademiska labb som forskar om rättvisa, bias eller persona-mångfald i AI-genererade dataset. Den fullständiga artikeln innehåller biasanalys över kön, ålder och branschrepresentation.


Vad du kan bygga med det

Vi byggde tre öppna verktyg med det här datasetet. Det kan du också göra.

1. Persona Matcher Ladda upp ditt webbplatsinnehåll eller dina produktbeskrivningar. Verktyget matchar dig mot de personas i datasetet som passar bäst, rangordnade efter semantisk likhet. Se det som "hitta min målgrupp" utifrån vad AI tolkar att ditt innehåll signalerar.

2. Benchmark Calculator Jämför din persona-täckning mot branschkollegor. Om du är ett B2B-SaaS-företag, hur står sig din målgruppsmångfald mot medianen? Överindexerar du på tekniska köpare och missar ekonomiska köpare?

3. AI Perception Readiness Index Poängsätt ditt varumärkes synlighet över AI-modeller. Datasetet driver utgångsläget: vilka personas är underbetjänade av dagens AI-rekommendationer, och var finns de strategiska luckorna?

Du kan replikera de här verktygen, förbättra dem eller bygga något helt annat. Datasetet är licensierat under Apache 2.0. Attribution krävs, kommersiell användning tillåten.


Vad det fullständiga datasetet erbjuder

Det fullständiga datasetet med 593,181 personas innehåller allt i delmängden på 15K, plus:

  • 40x mer täckning: 593,181 personas fördelade på 339 branscher (25 primära vertikaler) med djupare stratifiering på delsegmentsnivå
  • Longitudinell spårning: Personas utveckling över tid när vi regenererar datasetet varje kvartal
  • Narrativa berättelser: Fullständiga berättelser om köparens resa (borttagna från den publika delmängden för anonymisering)
  • Konkurrenskontext: Vilka personas som föredrar konkurrenter, och varför
  • API-åtkomst: Sök personas efter bransch, smärtpunkt eller sökintention via REST API
  • OEM-licensiering: White-label-integration i din produkt, med SLA och support

Det fullständiga datasetet är tillgängligt via företagslicensiering (EUR 25K-120K/år) eller API-prenumerationer (från EUR 2,500/månad). Kontakta oss på contact@rankfor.ai för priser och utvärderingsåtkomst.


Så här använder du datasetet

Ladda ner det från HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Läs in det i Python:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Citera forskningen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Länk till artikeln]

Utforska verktygen: Prova Persona Matcher, Benchmark Calculator eller AI Perception Readiness Index för att se vad du kan bygga med persona-data.


Varför det här spelar roll för ditt varumärke

Om AI-assistenter rekommenderar lösningar till dina potentiella kunder behöver du veta:

  1. Vilka personas som ställer frågor om din kategori som AI inte kan svara på (möjlighetsluckor)
  2. Vilka personas som AI rekommenderar till dina konkurrenter i stället för till dig (konkurrensmässig sårbarhet)
  3. Vilka personas du överinvesterar i med innehåll som AI redan gynnar (bortkastad ansträngning)

Det här datasetet är grunden för den analysen. Delmängden på 15K bevisar metodiken. Det fullständiga datasetet med 593K driver intelligenslagret som svarar på de här frågorna för ditt varumärke.

Ladda ner datasetet. Bygg med det. Om du behöver det fullständiga kommersiella datasetet är vi bara ett mejl bort.


Om Rankfor.AI: Vi hjälper B2B-marknadsteam att förstå sin AI-synlighet: vad AI-modeller vet om deras varumärke, vilka personas de når och var konkurrenterna dominerar samtalet. Vår plattform är byggd på det största publicerade datasetet med AI-genererade köparpersonas. Läs mer på rankfor.ai.

Ladda ner datasetet: HuggingFace Utforska verktygen: Persona Matcher | Benchmark Calculator | Readiness Score Licensiera det fullständiga datasetet: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Alla rättigheter förbehållna

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Vi använder cookies

Vi använder nödvändiga cookies för att få vår webbplats att fungera. Med ditt samtycke kan vi också använda analyskookies för att förstå hur du använder våra verktyg (som Dice Roller) så att vi kan förbättra dem. Läs mer