Key Findings
- 15,000 AI-generated buyer personas available on HuggingFace under Apache 2.0
- Stratified sample of the full PersonaGen-1M dataset
- Covers 25 industries with demographics, goals, pain points, and search queries
- Designed for validation and independent research replication
15 000 ostajapersoonaa julkaistu HuggingFacessa, jotta voidaan varmentaa mitä tekoäly ajattelee asiakkaidesi tarpeista, ja miksi emme julkaisseet kaikkia 593 000:ta.
Miksi julkaisimme tämän aineiston
Useimmat ostajapersoona-aineistot ovat joko synteettistä kohinaa tai lukittuina yritysten maksumuurien taakse. Julkaisimme PersonaGen-15K:n HuggingFacessa todistaaksemme toisenlaisen näkökulman: tekoälyn luomat persoonat ovat harha-aistimusten sijaan heijastus siitä, mitä tekoälymallit oppivat verkosta.
Tämä on 15 000 persoonan osajoukko koko 593 181 persoonan aineistostamme, historiallinen 10 prosentin otos aiemmasta 149 000 persoonan versiosta, joka julkaistiin Springerin Discover Artificial Intelligence -lehdessä. Se on ositettu toimialoittain, anonymisoitu ja pakattu yhteen 8,9 megatavun Parquet-tiedostoon. Koko aineisto on kaupallisen tekoälynäkyvyyden analytiikkaplatformimme perusta. Tämä osajoukko on todiste siitä.
Jos olet tutkija, data-analyytikko tai markkinointiteknologi ja kysyt "vastaavatko tekoälyn luomat persoonat todella oikeiden ostajien käyttäytymistä?", tämä on varmennusaineistosi. Jos harkitset koko aineiston lisensointia tuotteeseesi tai tutkimukseesi, tämä on laadun tarkistuspiste.
Voit ladata sen täältä: PersonaGen-15K HuggingFacessa.
Mitä aineisto sisältää
PersonaGen-15K sisältää 14 955 ostajapersoonaa 25 toimialalta, jotka on luotu Googlen Gemini 2.0 Flash -mallilla. Jokainen persoona sisältää:
- Demografiat: ikähaarukka, koulutus, työtehtävä, yrityksen koko
- Tavoitteet: mitä he pyrkivät saavuttamaan (liiketoiminnalliset tavoitteet, henkilökohtaiset lopputulokset)
- Kipupisteet: operatiivinen kitka, budjettirajoitteet, osaamisvajeet
- Hakukyselyt: kysymykset, joita he esittävät tekoälyavustajille ja hakukoneille
- Piilevät tarpeet: implisiittiset vaatimukset, joita ei mainita hauissa mutta jotka paljastuvat käyttäytymisanalyysissa
- Markkinakonteksti: toimiala, kilpailulliset paineet, sääntely-ympäristö
- Ostoa laukaisevat tekijät: tapahtumat, jotka siirtävät heidät tiedonhausta arviointiin
Aineisto on tallennettu ZSTD-pakattuun Parquet-muotoon tehokasta latausta varten pandas-, Polars- tai DuckDB-ympäristöissä. Toimialajakauma on säilytetty 0,2 prosentin tarkkuudella alkuperäiseen aineistoon nähden, mikä tarkoittaa, että ositettu otos on tilastollisesti edustava.
PersonaGen-15K: Dataset Composition
Anonymisointi: tiivistimme kaikki persoonien nimet muotoon Persona_{hash}, poistimme kertomukselliset tarinat ja poistimme sisäiset UUID-tunnisteet. Aineisto on tutkimustasoista, ei henkilötietoja.
Miksi 10 %, ei 100 %?
Koko 593 181 persoonan aineisto on kaupallinen tuotteemme. Se toimii tekoälynäkyvyyden analytiikan moottorina B2B-markkinointitiimeille, joiden on ymmärrettävä miten tekoälymallit suosittelevat heidän brändiään, tai jättävät suosittelematta.
Julkaisimme 10 prosenttia (15 000 persoonaa) kolmesta strategisesta syystä:
1. Varmennus, ei korvaaja. 15 000 persoonaa riittää tutkimuksemme toistamiseen, menetelmämme varmentamiseen ja konseptitodistustyökalujen rakentamiseen. Se ei riitä korvaamaan kaupallista aineistoa. Jos koulutat suositusmallia tai rakennat persoonahakukonetta, tarvitset koko 593 000:n aineiston.
2. Ilmainen näyte, joka todistaa laadun. Jokainen tutkija, joka lataa tämän aineiston ja viittaa siihen työssään, varmentaa menetelmämme. Jokainen datatiimi, joka arvioi sitä lisensointia varten, kokee skeeman syvyyden. Tämä on kysynnän luontia ilman asiakashankintakustannuksia.
3. Akateeminen arvovalta kertyy korkoa korolle. Julkaiseminen HuggingFacessa siteerattavalla DOI-tunnuksella tarkoittaa, että muut tutkijat viittaavat tähän aineistoon. Nuo viittaukset vahvistavat asemaamme: jos tutkit tekoälyn luomia persoonia, ostoaikeiden mallintamista tai LLM-suositusten käyttäytymistä, tämä on kanoninen aineisto.
Full Dataset vs Open Subset
Vertaa tuota 2 500 euron LinkedIn-mainoskampanjaan. HuggingFace tuo meille laadukkaampia liidejä, kuten tutkijoita, data-analyytikoita ja yritysten ML-tiimejä, 0 euron kustannuksella.
Kenelle tämä aineisto on tarkoitettu
Tutkijoille, jotka tutkivat tekoälyn käyttäytymistä, persoonien luontia tai ostoaikeiden mallintamista. Tämä on koulutusaineistosi sen arviointiin, kuinka hyvin tekoälymallit vangitsevat todellisia ostaja-arkkityyppejä.
Data-analyytikoille, jotka rakentavat suositusjärjestelmiä, hakurelevanssimalleja tai sisällön personointimoottoreita. Käytä tätä testataksesi, pystyykö mallisi ennustamaan, mitkä persoonat välittävät mistäkin ominaisuuksista.
Markkinointiteknologeille, jotka arvioivat työkaluja kuten HubSpot, Salesforce Marketing Cloud tai SEMrush. Jos toimittajasi väittää tarjoavansa "tekoälypohjaista ostajatietoa", voit nyt vertailla sen tuloksia julkaistuun aineistoon.
Tuotetiimeille martech- tai myyntitiedustelualustoilla. Jos harkitset koko aineiston lisensointia OEM-integraatioon (50 000–200 000 euroa vuodessa), tämä on arvonäyttösi.
Akateemisille laboratorioille, jotka tutkivat oikeudenmukaisuutta, vinoumia tai persoonien monimuotoisuutta tekoälyn luomissa aineistoissa. Koko artikkeli sisältää vinouma-analyysin sukupuolen, iän ja toimialaedustuksen mukaan.
Mitä voit rakentaa sen avulla
Rakensimme kolme avointa työkalua tämän aineiston avulla. Sinäkin voit.
1. Persona Matcher Lataa verkkosivustosi sisältö tai tuotekuvaukset. Työkalu yhdistää sinut aineiston resonoivimpiin persooniin, jotka on järjestetty semanttisen samankaltaisuuden mukaan. Ajattele sitä "löydä yleisöni" -työkaluna, joka perustuu siihen, mitä tekoäly ajattelee sisältösi viestivän.
2. Benchmark Calculator Vertaa persoonakattavuuttasi toimialan verrokkeihin. Jos olet B2B SaaS -yritys, miten yleisösi monimuotoisuus vertautuu mediaaniin? Ylipainotatko teknisiä ostajia ja jätätkö taloudelliset ostajat huomiotta?
3. AI Perception Readiness Index Pisteytä brändisi näkyvyys tekoälymalleissa. Aineisto toimii vertailukohdan moottorina: mitkä persoonat jäävät nykyisten tekoälysuositusten katvealueeseen, ja missä ovat strategiset aukot?
Voit toisintaa nämä työkalut, parantaa niitä tai rakentaa jotain aivan muuta. Aineisto on lisensoitu Apache 2.0 -lisenssillä. Attribuutio vaaditaan, kaupallinen käyttö on sallittua.
Mitä koko aineisto tarjoaa
Koko 593 181 persoonan aineisto sisältää kaiken, mitä 15 000:n osajoukossa on, sekä lisäksi:
- 40 kertaa laajempi kattavuus: 593 181 persoonaa 339 toimialalla (25 ensisijaista vertikaalia) syvemmällä alasegmenttien osituksella
- Pitkittäisseuranta: persoonien kehitys ajan myötä, kun luomme aineiston uudelleen neljännesvuosittain
- Kertomukselliset tarinat: täydelliset ostopolkukertomukset (poistettu julkisesta osajoukosta anonymisoinnin vuoksi)
- Kilpailukonteksti: mitkä persoonat suosivat kilpailijoita, ja miksi
- API-pääsy: kysele persoonia toimialan, kipupisteen tai hakuaikomuksen mukaan REST-rajapinnan kautta
- OEM-lisensointi: white label -integraatio tuotteeseesi, SLA:n ja tuen kanssa
Koko aineisto on saatavilla yrityslisensoinnin kautta (25 000–120 000 euroa vuodessa) tai API-tilauksina (alkaen 2 500 euroa kuukaudessa). Ota meihin yhteyttä osoitteessa contact@rankfor.ai saadaksesi hinnoittelu- ja arviointipääsyn.
Miten tätä aineistoa käytetään
Lataa se HuggingFacesta: https://huggingface.co/datasets/Rankfor/PersonaGen-15K
Lataa se Pythonissa:
import pandas as pd
df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())
Viittaa tutkimukseen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]
Tutustu työkaluihin: kokeile työkaluja Persona Matcher, Benchmark Calculator tai AI Perception Readiness Index nähdäksesi, mitä voit rakentaa persoonadatalla.
Miksi tällä on merkitystä brändillesi
Jos tekoälyavustajat suosittelevat ratkaisuja mahdollisille asiakkaillesi, sinun on tiedettävä:
- Mitkä persoonat esittävät kysymyksiä, joihin tekoäly ei osaa vastata kategoriastasi (mahdollisuusaukot)
- Mitkä persoonat tekoäly suosittelee kilpailijoillesi sinun sijaasi (kilpailullinen haavoittuvuus)
- Mihin persooniin ylipanostat sisällöllä, jota tekoäly jo suosii (hukattu vaiva)
Tämä aineisto on kyseisen analyysin perusta. 15 000:n osajoukko todistaa menetelmän. Koko 593 000:n aineisto pyörittää sitä analytiikkakerrosta, joka vastaa noihin kysymyksiin brändisi puolesta.
Lataa aineisto. Rakenna sen avulla. Jos tarvitset koko kaupallisen aineiston, olemme yhden sähköpostin päässä.
Tietoa Rankfor.AI:sta: autamme B2B-markkinointitiimejä ymmärtämään tekoälynäkyvyyttään, eli mitä tekoälymallit tietävät heidän brändistään, mitkä persoonat he tavoittavat ja missä kilpailijat hallitsevat keskustelua. Platformimme perustuu suurimpaan julkaistuun aineistoon tekoälyn luomista ostajapersoonista. Lue lisää osoitteessa rankfor.ai.
Lataa aineisto: HuggingFace Tutustu työkaluihin: Persona Matcher | Benchmark Calculator | Readiness Score Lisensoi koko aineisto: contact@rankfor.ai
People Also Ask
Continue Reading
PersonaGen-Enterprise: B2B Buying Intelligence Dataset on HuggingFace
5,000 enterprise B2B buyer personas with full buying committee modeling across 15 industries, 47,019 real search queries, and 7,500 competitive brand queries. Anonymized sample from 130K personas generated by 5 LLMs. CC BY 4.0 licensed.
What AI Thinks Your Buyers Want: Insights from 1,031,732 Buyer Personas
We analyzed what AI actually believes about buyers across 500+ industries. Key findings from the largest buyer persona dataset ever published.
Your CRM Personas Are Based on Who Already Buys. AI Personas Are Based on Who Is Searching.
We analyzed 1,031,732 real AI-generated buyer personas and built a tool that shows you the gap between your assumed audience and AI's assumed audience. That gap determines whether AI recommends you.
Why Your Industry's AI Readiness Score Predicts Your Next Quarter's Content ROI
We ranked industries by AI readiness using 1,031,732 buyer personas. Grade A industries are saturated - every competitor knows how to win. Grade C industries are wide open. The playbook has not been written yet. Your industry's score predicts which strategy works.
BeVisible Club
Get research like this before we publish it.
New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.
Join BeVisible ClubWant to Know How AI Sees Your Brand?
Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.
About the Author

Founder
Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.
