article

PersonaGen-15K: ensimmäinen avoin aineisto tekoälyn luomista ostajapersoonista

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15 000 ostajapersoonaa julkaistu HuggingFacessa, jotta voidaan varmentaa mitä tekoäly ajattelee asiakkaidesi tarpeista, ja miksi emme julkaisseet kaikkia 593 000:ta.


Miksi julkaisimme tämän aineiston

Useimmat ostajapersoona-aineistot ovat joko synteettistä kohinaa tai lukittuina yritysten maksumuurien taakse. Julkaisimme PersonaGen-15K:n HuggingFacessa todistaaksemme toisenlaisen näkökulman: tekoälyn luomat persoonat ovat harha-aistimusten sijaan heijastus siitä, mitä tekoälymallit oppivat verkosta.

Tämä on 15 000 persoonan osajoukko koko 593 181 persoonan aineistostamme, historiallinen 10 prosentin otos aiemmasta 149 000 persoonan versiosta, joka julkaistiin Springerin Discover Artificial Intelligence -lehdessä. Se on ositettu toimialoittain, anonymisoitu ja pakattu yhteen 8,9 megatavun Parquet-tiedostoon. Koko aineisto on kaupallisen tekoälynäkyvyyden analytiikkaplatformimme perusta. Tämä osajoukko on todiste siitä.

Jos olet tutkija, data-analyytikko tai markkinointiteknologi ja kysyt "vastaavatko tekoälyn luomat persoonat todella oikeiden ostajien käyttäytymistä?", tämä on varmennusaineistosi. Jos harkitset koko aineiston lisensointia tuotteeseesi tai tutkimukseesi, tämä on laadun tarkistuspiste.

Voit ladata sen täältä: PersonaGen-15K HuggingFacessa.


Mitä aineisto sisältää

PersonaGen-15K sisältää 14 955 ostajapersoonaa 25 toimialalta, jotka on luotu Googlen Gemini 2.0 Flash -mallilla. Jokainen persoona sisältää:

  • Demografiat: ikähaarukka, koulutus, työtehtävä, yrityksen koko
  • Tavoitteet: mitä he pyrkivät saavuttamaan (liiketoiminnalliset tavoitteet, henkilökohtaiset lopputulokset)
  • Kipupisteet: operatiivinen kitka, budjettirajoitteet, osaamisvajeet
  • Hakukyselyt: kysymykset, joita he esittävät tekoälyavustajille ja hakukoneille
  • Piilevät tarpeet: implisiittiset vaatimukset, joita ei mainita hauissa mutta jotka paljastuvat käyttäytymisanalyysissa
  • Markkinakonteksti: toimiala, kilpailulliset paineet, sääntely-ympäristö
  • Ostoa laukaisevat tekijät: tapahtumat, jotka siirtävät heidät tiedonhausta arviointiin

Aineisto on tallennettu ZSTD-pakattuun Parquet-muotoon tehokasta latausta varten pandas-, Polars- tai DuckDB-ympäristöissä. Toimialajakauma on säilytetty 0,2 prosentin tarkkuudella alkuperäiseen aineistoon nähden, mikä tarkoittaa, että ositettu otos on tilastollisesti edustava.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonymisointi: tiivistimme kaikki persoonien nimet muotoon Persona_{hash}, poistimme kertomukselliset tarinat ja poistimme sisäiset UUID-tunnisteet. Aineisto on tutkimustasoista, ei henkilötietoja.


Miksi 10 %, ei 100 %?

Koko 593 181 persoonan aineisto on kaupallinen tuotteemme. Se toimii tekoälynäkyvyyden analytiikan moottorina B2B-markkinointitiimeille, joiden on ymmärrettävä miten tekoälymallit suosittelevat heidän brändiään, tai jättävät suosittelematta.

Julkaisimme 10 prosenttia (15 000 persoonaa) kolmesta strategisesta syystä:

1. Varmennus, ei korvaaja. 15 000 persoonaa riittää tutkimuksemme toistamiseen, menetelmämme varmentamiseen ja konseptitodistustyökalujen rakentamiseen. Se ei riitä korvaamaan kaupallista aineistoa. Jos koulutat suositusmallia tai rakennat persoonahakukonetta, tarvitset koko 593 000:n aineiston.

2. Ilmainen näyte, joka todistaa laadun. Jokainen tutkija, joka lataa tämän aineiston ja viittaa siihen työssään, varmentaa menetelmämme. Jokainen datatiimi, joka arvioi sitä lisensointia varten, kokee skeeman syvyyden. Tämä on kysynnän luontia ilman asiakashankintakustannuksia.

3. Akateeminen arvovalta kertyy korkoa korolle. Julkaiseminen HuggingFacessa siteerattavalla DOI-tunnuksella tarkoittaa, että muut tutkijat viittaavat tähän aineistoon. Nuo viittaukset vahvistavat asemaamme: jos tutkit tekoälyn luomia persoonia, ostoaikeiden mallintamista tai LLM-suositusten käyttäytymistä, tämä on kanoninen aineisto.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Vertaa tuota 2 500 euron LinkedIn-mainoskampanjaan. HuggingFace tuo meille laadukkaampia liidejä, kuten tutkijoita, data-analyytikoita ja yritysten ML-tiimejä, 0 euron kustannuksella.


Kenelle tämä aineisto on tarkoitettu

Tutkijoille, jotka tutkivat tekoälyn käyttäytymistä, persoonien luontia tai ostoaikeiden mallintamista. Tämä on koulutusaineistosi sen arviointiin, kuinka hyvin tekoälymallit vangitsevat todellisia ostaja-arkkityyppejä.

Data-analyytikoille, jotka rakentavat suositusjärjestelmiä, hakurelevanssimalleja tai sisällön personointimoottoreita. Käytä tätä testataksesi, pystyykö mallisi ennustamaan, mitkä persoonat välittävät mistäkin ominaisuuksista.

Markkinointiteknologeille, jotka arvioivat työkaluja kuten HubSpot, Salesforce Marketing Cloud tai SEMrush. Jos toimittajasi väittää tarjoavansa "tekoälypohjaista ostajatietoa", voit nyt vertailla sen tuloksia julkaistuun aineistoon.

Tuotetiimeille martech- tai myyntitiedustelualustoilla. Jos harkitset koko aineiston lisensointia OEM-integraatioon (50 000–200 000 euroa vuodessa), tämä on arvonäyttösi.

Akateemisille laboratorioille, jotka tutkivat oikeudenmukaisuutta, vinoumia tai persoonien monimuotoisuutta tekoälyn luomissa aineistoissa. Koko artikkeli sisältää vinouma-analyysin sukupuolen, iän ja toimialaedustuksen mukaan.


Mitä voit rakentaa sen avulla

Rakensimme kolme avointa työkalua tämän aineiston avulla. Sinäkin voit.

1. Persona Matcher Lataa verkkosivustosi sisältö tai tuotekuvaukset. Työkalu yhdistää sinut aineiston resonoivimpiin persooniin, jotka on järjestetty semanttisen samankaltaisuuden mukaan. Ajattele sitä "löydä yleisöni" -työkaluna, joka perustuu siihen, mitä tekoäly ajattelee sisältösi viestivän.

2. Benchmark Calculator Vertaa persoonakattavuuttasi toimialan verrokkeihin. Jos olet B2B SaaS -yritys, miten yleisösi monimuotoisuus vertautuu mediaaniin? Ylipainotatko teknisiä ostajia ja jätätkö taloudelliset ostajat huomiotta?

3. AI Perception Readiness Index Pisteytä brändisi näkyvyys tekoälymalleissa. Aineisto toimii vertailukohdan moottorina: mitkä persoonat jäävät nykyisten tekoälysuositusten katvealueeseen, ja missä ovat strategiset aukot?

Voit toisintaa nämä työkalut, parantaa niitä tai rakentaa jotain aivan muuta. Aineisto on lisensoitu Apache 2.0 -lisenssillä. Attribuutio vaaditaan, kaupallinen käyttö on sallittua.


Mitä koko aineisto tarjoaa

Koko 593 181 persoonan aineisto sisältää kaiken, mitä 15 000:n osajoukossa on, sekä lisäksi:

  • 40 kertaa laajempi kattavuus: 593 181 persoonaa 339 toimialalla (25 ensisijaista vertikaalia) syvemmällä alasegmenttien osituksella
  • Pitkittäisseuranta: persoonien kehitys ajan myötä, kun luomme aineiston uudelleen neljännesvuosittain
  • Kertomukselliset tarinat: täydelliset ostopolkukertomukset (poistettu julkisesta osajoukosta anonymisoinnin vuoksi)
  • Kilpailukonteksti: mitkä persoonat suosivat kilpailijoita, ja miksi
  • API-pääsy: kysele persoonia toimialan, kipupisteen tai hakuaikomuksen mukaan REST-rajapinnan kautta
  • OEM-lisensointi: white label -integraatio tuotteeseesi, SLA:n ja tuen kanssa

Koko aineisto on saatavilla yrityslisensoinnin kautta (25 000–120 000 euroa vuodessa) tai API-tilauksina (alkaen 2 500 euroa kuukaudessa). Ota meihin yhteyttä osoitteessa contact@rankfor.ai saadaksesi hinnoittelu- ja arviointipääsyn.


Miten tätä aineistoa käytetään

Lataa se HuggingFacesta: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Lataa se Pythonissa:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Viittaa tutkimukseen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]

Tutustu työkaluihin: kokeile työkaluja Persona Matcher, Benchmark Calculator tai AI Perception Readiness Index nähdäksesi, mitä voit rakentaa persoonadatalla.


Miksi tällä on merkitystä brändillesi

Jos tekoälyavustajat suosittelevat ratkaisuja mahdollisille asiakkaillesi, sinun on tiedettävä:

  1. Mitkä persoonat esittävät kysymyksiä, joihin tekoäly ei osaa vastata kategoriastasi (mahdollisuusaukot)
  2. Mitkä persoonat tekoäly suosittelee kilpailijoillesi sinun sijaasi (kilpailullinen haavoittuvuus)
  3. Mihin persooniin ylipanostat sisällöllä, jota tekoäly jo suosii (hukattu vaiva)

Tämä aineisto on kyseisen analyysin perusta. 15 000:n osajoukko todistaa menetelmän. Koko 593 000:n aineisto pyörittää sitä analytiikkakerrosta, joka vastaa noihin kysymyksiin brändisi puolesta.

Lataa aineisto. Rakenna sen avulla. Jos tarvitset koko kaupallisen aineiston, olemme yhden sähköpostin päässä.


Tietoa Rankfor.AI:sta: autamme B2B-markkinointitiimejä ymmärtämään tekoälynäkyvyyttään, eli mitä tekoälymallit tietävät heidän brändistään, mitkä persoonat he tavoittavat ja missä kilpailijat hallitsevat keskustelua. Platformimme perustuu suurimpaan julkaistuun aineistoon tekoälyn luomista ostajapersoonista. Lue lisää osoitteessa rankfor.ai.

Lataa aineisto: HuggingFace Tutustu työkaluihin: Persona Matcher | Benchmark Calculator | Readiness Score Lisensoi koko aineisto: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Kaikki oikeudet pidätetään

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Käytämme evästeitä

Käytämme välttämättömiä evästeitä saadaksemme sivustomme toimimaan. Suostumuksellanne voimme käyttää myös analytiikkaevästeitä ymmärtääksemme, miten käytätte työkalujamme (kuten Dice Rolleria), jotta voimme parantaa niitä. Lue lisää