15,000 köparpersonas publicerade på HuggingFace för att validera vad AI tror att dina kunder vill ha, och varför vi inte publicerade alla 593K.
Därför publicerade vi det här datasetet
De flesta dataset med köparpersonas är antingen syntetiskt brus eller inlåsta bakom betalväggar för företag. Vi publicerade PersonaGen-15K på HuggingFace för att bevisa något annat: AI-genererade personas är inga hallucinationer, de speglar vad AI-modeller lär sig från webben.
Det här är en delmängd på 15,000 personas ur vårt fullständiga dataset med 593,181 personas, ett historiskt urval på 10% från den tidigare versionen med 149K, publicerat i Springers tidskrift Discover Artificial Intelligence. Det är stratifierat efter bransch, anonymiserat och komprimerat till en enda Parquet-fil på 8.9 MB. Det fullständiga datasetet är grunden för vår kommersiella plattform för AI-synlighetsintelligens. Den här delmängden är beviset.
Om du är forskare, dataforskare eller marknadsteknolog och undrar "mappar AI-genererade personas verkligen mot verkligt köpbeteende?", då är det här ditt valideringsset. Om du överväger att licensiera det fullständiga datasetet för din produkt eller forskning, är det här din kvalitetskontroll.
Du kan ladda ner det här: PersonaGen-15K på HuggingFace.
Vad datasetet innehåller
PersonaGen-15K innehåller 14,955 köparpersonas fördelade på 25 branscher, genererade med Googles Gemini 2.0 Flash. Varje persona innehåller:
- Demografi: Åldersintervall, utbildning, jobbfunktion, företagsstorlek
- Mål: Vad de försöker uppnå (affärsmål, personliga resultat)
- Smärtpunkter: Operativ friktion, budgetbegränsningar, kapacitetsluckor
- Sökfrågor: Frågorna de ställer till AI-assistenter och sökmotorer
- Oupptäckta behov: Underförstådda krav som inte uttrycks i sökningar men avslöjas genom beteendeanalys
- Marknadskontext: Bransch, konkurrenstryck, regelverk
- Köputlösare: Händelser som får dem att gå från research till utvärdering
Datasetet lagras i ZSTD-komprimerat Parquet-format för effektiv inläsning i pandas, Polars eller DuckDB. Branschfördelningen bevaras inom 0.2% av det ursprungliga datasetet, vilket innebär att det stratifierade urvalet är statistiskt representativt.
PersonaGen-15K: Datasetets sammansättning
Anonymisering: Vi hashade alla persona-namn till Persona_{hash}, tog bort narrativa berättelser och avlägsnade interna UUID:er. Datasetet håller forskningskvalitet och innehåller inga personuppgifter.
Varför 10%, inte 100%?
Det fullständiga datasetet med 593,181 personas är vår kommersiella produkt. Det driver AI-synlighetsintelligens för B2B-marknadsteam som behöver förstå hur AI-modeller rekommenderar deras varumärke, eller inte gör det.
Vi publicerade 10% (15K personas) av tre strategiska skäl:
1. Validering, inte ersättning. 15,000 personas räcker för att reproducera vår forskning, validera vår metodik och bygga proof-of-concept-verktyg. Det räcker inte för att ersätta det kommersiella datasetet. Om du tränar en rekommendationsmodell eller bygger en sökmotor för personas behöver du hela 593K.
2. Gratisprovet som bevisar kvaliteten. Varje forskare som laddar ner det här datasetet och citerar det i sitt arbete validerar vår metodik. Varje datateam som utvärderar det för licensiering upplever schemats djup. Det här är efterfrågegenerering till noll kostnad för kundanskaffning.
3. Akademisk auktoritet växer med tiden. Att publicera på HuggingFace med en citerbar DOI innebär att andra forskare refererar till det här datasetet. Dessa citeringar stärker vår position: om du studerar AI-genererade personas, modellering av köpintention eller LLM-rekommendationsbeteende är det här det kanoniska datasetet.
Fullständigt dataset vs öppen delmängd
Jämför det med en LinkedIn-annonskampanj för EUR 2,500. HuggingFace ger oss leads av högre kvalitet, forskare, dataforskare, ML-team på företag, till en kostnad av EUR 0.
Vem det här datasetet är för
Forskare som studerar AI-beteende, personagenerering eller modellering av köpintention. Det här är ditt träningsset för att utvärdera hur väl AI-modeller fångar verkliga köparearketyper.
Dataforskare som bygger rekommendationssystem, modeller för sökrelevans eller motorer för innehållspersonalisering. Använd det för att testa om din modell kan förutsäga vilka personas som bryr sig om vilka funktioner.
Marknadsteknologer som utvärderar verktyg som HubSpot, Salesforce Marketing Cloud eller SEMrush. Om din leverantör hävdar "AI-drivna köparinsikter" kan du nu jämföra deras resultat mot ett publicerat dataset.
Produktteam på martech- eller sales intelligence-plattformar. Om du överväger att licensiera det fullständiga datasetet för OEM-integration (EUR 50K-200K/år) är det här ditt bevis på värde.
Akademiska labb som forskar om rättvisa, bias eller persona-mångfald i AI-genererade dataset. Den fullständiga artikeln innehåller biasanalys över kön, ålder och branschrepresentation.
Vad du kan bygga med det
Vi byggde tre öppna verktyg med det här datasetet. Det kan du också göra.
1. Persona Matcher Ladda upp ditt webbplatsinnehåll eller dina produktbeskrivningar. Verktyget matchar dig mot de personas i datasetet som passar bäst, rangordnade efter semantisk likhet. Se det som "hitta min målgrupp" utifrån vad AI tolkar att ditt innehåll signalerar.
2. Benchmark Calculator Jämför din persona-täckning mot branschkollegor. Om du är ett B2B-SaaS-företag, hur står sig din målgruppsmångfald mot medianen? Överindexerar du på tekniska köpare och missar ekonomiska köpare?
3. AI Perception Readiness Index Poängsätt ditt varumärkes synlighet över AI-modeller. Datasetet driver utgångsläget: vilka personas är underbetjänade av dagens AI-rekommendationer, och var finns de strategiska luckorna?
Du kan replikera de här verktygen, förbättra dem eller bygga något helt annat. Datasetet är licensierat under Apache 2.0. Attribution krävs, kommersiell användning tillåten.
Vad det fullständiga datasetet erbjuder
Det fullständiga datasetet med 593,181 personas innehåller allt i delmängden på 15K, plus:
- 40x mer täckning: 593,181 personas fördelade på 339 branscher (25 primära vertikaler) med djupare stratifiering på delsegmentsnivå
- Longitudinell spårning: Personas utveckling över tid när vi regenererar datasetet varje kvartal
- Narrativa berättelser: Fullständiga berättelser om köparens resa (borttagna från den publika delmängden för anonymisering)
- Konkurrenskontext: Vilka personas som föredrar konkurrenter, och varför
- API-åtkomst: Sök personas efter bransch, smärtpunkt eller sökintention via REST API
- OEM-licensiering: White-label-integration i din produkt, med SLA och support
Det fullständiga datasetet är tillgängligt via företagslicensiering (EUR 25K-120K/år) eller API-prenumerationer (från EUR 2,500/månad). Kontakta oss på contact@rankfor.ai för priser och utvärderingsåtkomst.
Så här använder du datasetet
Ladda ner det från HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K
Läs in det i Python:
import pandas as pd
df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())
Citera forskningen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Länk till artikeln]
Utforska verktygen: Prova Persona Matcher, Benchmark Calculator eller AI Perception Readiness Index för att se vad du kan bygga med persona-data.
Varför det här spelar roll för ditt varumärke
Om AI-assistenter rekommenderar lösningar till dina potentiella kunder behöver du veta:
- Vilka personas som ställer frågor om din kategori som AI inte kan svara på (möjlighetsluckor)
- Vilka personas som AI rekommenderar till dina konkurrenter i stället för till dig (konkurrensmässig sårbarhet)
- Vilka personas du överinvesterar i med innehåll som AI redan gynnar (bortkastad ansträngning)
Det här datasetet är grunden för den analysen. Delmängden på 15K bevisar metodiken. Det fullständiga datasetet med 593K driver intelligenslagret som svarar på de här frågorna för ditt varumärke.
Ladda ner datasetet. Bygg med det. Om du behöver det fullständiga kommersiella datasetet är vi bara ett mejl bort.
Om Rankfor.AI: Vi hjälper B2B-marknadsteam att förstå sin AI-synlighet: vad AI-modeller vet om deras varumärke, vilka personas de når och var konkurrenterna dominerar samtalet. Vår plattform är byggd på det största publicerade datasetet med AI-genererade köparpersonas. Läs mer på rankfor.ai.
Ladda ner datasetet: HuggingFace Utforska verktygen: Persona Matcher | Benchmark Calculator | Readiness Score Licensiera det fullständiga datasetet: contact@rankfor.ai
