15 000 ostajapersoonaa julkaistu HuggingFacessa, jotta voidaan varmentaa mitä tekoäly ajattelee asiakkaidesi tarpeista, ja miksi emme julkaisseet kaikkia 593 000:ta.
Miksi julkaisimme tämän aineiston
Useimmat ostajapersoona-aineistot ovat joko synteettistä kohinaa tai lukittuina yritysten maksumuurien taakse. Julkaisimme PersonaGen-15K:n HuggingFacessa todistaaksemme toisenlaisen näkökulman: tekoälyn luomat persoonat ovat harha-aistimusten sijaan heijastus siitä, mitä tekoälymallit oppivat verkosta.
Tämä on 15 000 persoonan osajoukko koko 593 181 persoonan aineistostamme, historiallinen 10 prosentin otos aiemmasta 149 000 persoonan versiosta, joka julkaistiin Springerin Discover Artificial Intelligence -lehdessä. Se on ositettu toimialoittain, anonymisoitu ja pakattu yhteen 8,9 megatavun Parquet-tiedostoon. Koko aineisto on kaupallisen tekoälynäkyvyyden analytiikkaplatformimme perusta. Tämä osajoukko on todiste siitä.
Jos olet tutkija, data-analyytikko tai markkinointiteknologi ja kysyt "vastaavatko tekoälyn luomat persoonat todella oikeiden ostajien käyttäytymistä?", tämä on varmennusaineistosi. Jos harkitset koko aineiston lisensointia tuotteeseesi tai tutkimukseesi, tämä on laadun tarkistuspiste.
Voit ladata sen täältä: PersonaGen-15K HuggingFacessa.
Mitä aineisto sisältää
PersonaGen-15K sisältää 14 955 ostajapersoonaa 25 toimialalta, jotka on luotu Googlen Gemini 2.0 Flash -mallilla. Jokainen persoona sisältää:
- Demografiat: ikähaarukka, koulutus, työtehtävä, yrityksen koko
- Tavoitteet: mitä he pyrkivät saavuttamaan (liiketoiminnalliset tavoitteet, henkilökohtaiset lopputulokset)
- Kipupisteet: operatiivinen kitka, budjettirajoitteet, osaamisvajeet
- Hakukyselyt: kysymykset, joita he esittävät tekoälyavustajille ja hakukoneille
- Piilevät tarpeet: implisiittiset vaatimukset, joita ei mainita hauissa mutta jotka paljastuvat käyttäytymisanalyysissa
- Markkinakonteksti: toimiala, kilpailulliset paineet, sääntely-ympäristö
- Ostoa laukaisevat tekijät: tapahtumat, jotka siirtävät heidät tiedonhausta arviointiin
Aineisto on tallennettu ZSTD-pakattuun Parquet-muotoon tehokasta latausta varten pandas-, Polars- tai DuckDB-ympäristöissä. Toimialajakauma on säilytetty 0,2 prosentin tarkkuudella alkuperäiseen aineistoon nähden, mikä tarkoittaa, että ositettu otos on tilastollisesti edustava.
PersonaGen-15K: Dataset Composition
Anonymisointi: tiivistimme kaikki persoonien nimet muotoon Persona_{hash}, poistimme kertomukselliset tarinat ja poistimme sisäiset UUID-tunnisteet. Aineisto on tutkimustasoista, ei henkilötietoja.
Miksi 10 %, ei 100 %?
Koko 593 181 persoonan aineisto on kaupallinen tuotteemme. Se toimii tekoälynäkyvyyden analytiikan moottorina B2B-markkinointitiimeille, joiden on ymmärrettävä miten tekoälymallit suosittelevat heidän brändiään, tai jättävät suosittelematta.
Julkaisimme 10 prosenttia (15 000 persoonaa) kolmesta strategisesta syystä:
1. Varmennus, ei korvaaja. 15 000 persoonaa riittää tutkimuksemme toistamiseen, menetelmämme varmentamiseen ja konseptitodistustyökalujen rakentamiseen. Se ei riitä korvaamaan kaupallista aineistoa. Jos koulutat suositusmallia tai rakennat persoonahakukonetta, tarvitset koko 593 000:n aineiston.
2. Ilmainen näyte, joka todistaa laadun. Jokainen tutkija, joka lataa tämän aineiston ja viittaa siihen työssään, varmentaa menetelmämme. Jokainen datatiimi, joka arvioi sitä lisensointia varten, kokee skeeman syvyyden. Tämä on kysynnän luontia ilman asiakashankintakustannuksia.
3. Akateeminen arvovalta kertyy korkoa korolle. Julkaiseminen HuggingFacessa siteerattavalla DOI-tunnuksella tarkoittaa, että muut tutkijat viittaavat tähän aineistoon. Nuo viittaukset vahvistavat asemaamme: jos tutkit tekoälyn luomia persoonia, ostoaikeiden mallintamista tai LLM-suositusten käyttäytymistä, tämä on kanoninen aineisto.
Full Dataset vs Open Subset
Vertaa tuota 2 500 euron LinkedIn-mainoskampanjaan. HuggingFace tuo meille laadukkaampia liidejä, kuten tutkijoita, data-analyytikoita ja yritysten ML-tiimejä, 0 euron kustannuksella.
Kenelle tämä aineisto on tarkoitettu
Tutkijoille, jotka tutkivat tekoälyn käyttäytymistä, persoonien luontia tai ostoaikeiden mallintamista. Tämä on koulutusaineistosi sen arviointiin, kuinka hyvin tekoälymallit vangitsevat todellisia ostaja-arkkityyppejä.
Data-analyytikoille, jotka rakentavat suositusjärjestelmiä, hakurelevanssimalleja tai sisällön personointimoottoreita. Käytä tätä testataksesi, pystyykö mallisi ennustamaan, mitkä persoonat välittävät mistäkin ominaisuuksista.
Markkinointiteknologeille, jotka arvioivat työkaluja kuten HubSpot, Salesforce Marketing Cloud tai SEMrush. Jos toimittajasi väittää tarjoavansa "tekoälypohjaista ostajatietoa", voit nyt vertailla sen tuloksia julkaistuun aineistoon.
Tuotetiimeille martech- tai myyntitiedustelualustoilla. Jos harkitset koko aineiston lisensointia OEM-integraatioon (50 000–200 000 euroa vuodessa), tämä on arvonäyttösi.
Akateemisille laboratorioille, jotka tutkivat oikeudenmukaisuutta, vinoumia tai persoonien monimuotoisuutta tekoälyn luomissa aineistoissa. Koko artikkeli sisältää vinouma-analyysin sukupuolen, iän ja toimialaedustuksen mukaan.
Mitä voit rakentaa sen avulla
Rakensimme kolme avointa työkalua tämän aineiston avulla. Sinäkin voit.
1. Persona Matcher Lataa verkkosivustosi sisältö tai tuotekuvaukset. Työkalu yhdistää sinut aineiston resonoivimpiin persooniin, jotka on järjestetty semanttisen samankaltaisuuden mukaan. Ajattele sitä "löydä yleisöni" -työkaluna, joka perustuu siihen, mitä tekoäly ajattelee sisältösi viestivän.
2. Benchmark Calculator Vertaa persoonakattavuuttasi toimialan verrokkeihin. Jos olet B2B SaaS -yritys, miten yleisösi monimuotoisuus vertautuu mediaaniin? Ylipainotatko teknisiä ostajia ja jätätkö taloudelliset ostajat huomiotta?
3. AI Perception Readiness Index Pisteytä brändisi näkyvyys tekoälymalleissa. Aineisto toimii vertailukohdan moottorina: mitkä persoonat jäävät nykyisten tekoälysuositusten katvealueeseen, ja missä ovat strategiset aukot?
Voit toisintaa nämä työkalut, parantaa niitä tai rakentaa jotain aivan muuta. Aineisto on lisensoitu Apache 2.0 -lisenssillä. Attribuutio vaaditaan, kaupallinen käyttö on sallittua.
Mitä koko aineisto tarjoaa
Koko 593 181 persoonan aineisto sisältää kaiken, mitä 15 000:n osajoukossa on, sekä lisäksi:
- 40 kertaa laajempi kattavuus: 593 181 persoonaa 339 toimialalla (25 ensisijaista vertikaalia) syvemmällä alasegmenttien osituksella
- Pitkittäisseuranta: persoonien kehitys ajan myötä, kun luomme aineiston uudelleen neljännesvuosittain
- Kertomukselliset tarinat: täydelliset ostopolkukertomukset (poistettu julkisesta osajoukosta anonymisoinnin vuoksi)
- Kilpailukonteksti: mitkä persoonat suosivat kilpailijoita, ja miksi
- API-pääsy: kysele persoonia toimialan, kipupisteen tai hakuaikomuksen mukaan REST-rajapinnan kautta
- OEM-lisensointi: white label -integraatio tuotteeseesi, SLA:n ja tuen kanssa
Koko aineisto on saatavilla yrityslisensoinnin kautta (25 000–120 000 euroa vuodessa) tai API-tilauksina (alkaen 2 500 euroa kuukaudessa). Ota meihin yhteyttä osoitteessa contact@rankfor.ai saadaksesi hinnoittelu- ja arviointipääsyn.
Miten tätä aineistoa käytetään
Lataa se HuggingFacesta: https://huggingface.co/datasets/Rankfor/PersonaGen-15K
Lataa se Pythonissa:
import pandas as pd
df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())
Viittaa tutkimukseen: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]
Tutustu työkaluihin: kokeile työkaluja Persona Matcher, Benchmark Calculator tai AI Perception Readiness Index nähdäksesi, mitä voit rakentaa persoonadatalla.
Miksi tällä on merkitystä brändillesi
Jos tekoälyavustajat suosittelevat ratkaisuja mahdollisille asiakkaillesi, sinun on tiedettävä:
- Mitkä persoonat esittävät kysymyksiä, joihin tekoäly ei osaa vastata kategoriastasi (mahdollisuusaukot)
- Mitkä persoonat tekoäly suosittelee kilpailijoillesi sinun sijaasi (kilpailullinen haavoittuvuus)
- Mihin persooniin ylipanostat sisällöllä, jota tekoäly jo suosii (hukattu vaiva)
Tämä aineisto on kyseisen analyysin perusta. 15 000:n osajoukko todistaa menetelmän. Koko 593 000:n aineisto pyörittää sitä analytiikkakerrosta, joka vastaa noihin kysymyksiin brändisi puolesta.
Lataa aineisto. Rakenna sen avulla. Jos tarvitset koko kaupallisen aineiston, olemme yhden sähköpostin päässä.
Tietoa Rankfor.AI:sta: autamme B2B-markkinointitiimejä ymmärtämään tekoälynäkyvyyttään, eli mitä tekoälymallit tietävät heidän brändistään, mitkä persoonat he tavoittavat ja missä kilpailijat hallitsevat keskustelua. Platformimme perustuu suurimpaan julkaistuun aineistoon tekoälyn luomista ostajapersoonista. Lue lisää osoitteessa rankfor.ai.
Lataa aineisto: HuggingFace Tutustu työkaluihin: Persona Matcher | Benchmark Calculator | Readiness Score Lisensoi koko aineisto: contact@rankfor.ai
