OpenRankfor.AI
article

PersonaGen-15K: Pierwszy otwarty zbiór danych z personami zakupowymi generowanymi przez AI

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15 000 person zakupowych opublikowanych na HuggingFace, żeby zweryfikować, co AI myśli o potrzebach Twoich klientów, oraz wyjaśnienie, dlaczego nie opublikowaliśmy wszystkich 593 tys.


Dlaczego opublikowaliśmy ten zbiór danych

Większość zbiorów danych z personami zakupowymi to albo syntetyczny szum, albo dane zamknięte za korporacyjnymi opłatami licencyjnymi. Opublikowaliśmy PersonaGen-15K na HuggingFace, żeby udowodnić coś innego: persony generowane przez AI to nie halucynacje. Są odbiciem tego, czego modele AI uczą się z sieci.

To podzbiór 15 000 person z naszego pełnego zbioru liczącego 593 181 person, historyczna próba 10% z wcześniejszej wersji 149 tys., opublikowana w czasopiśmie Discover Artificial Intelligence wydawnictwa Springer. Jest stratyfikowany według branży, zanonimizowany i skompresowany do jednego pliku Parquet o rozmiarze 8,9 MB. Pełny zbiór danych stanowi fundament naszej komercyjnej platformy analitycznej do widoczności w AI. Ten podzbiór jest dowodem.

Jeśli jesteś badaczem, data scientistem albo technologiem marketingu i zadajesz pytanie „czy persony generowane przez AI faktycznie odwzorowują rzeczywiste zachowania zakupowe?”, to jest Twój zestaw walidacyjny. Jeśli rozważasz zakup licencji na pełny zbiór danych do swojego produktu albo badań, to jest Twoja kontrola jakości.

Możesz go pobrać tutaj: PersonaGen-15K na HuggingFace.


Co znajdziesz w zbiorze danych

PersonaGen-15K zawiera 14 955 person zakupowych z 25 branż, wygenerowanych przy użyciu Gemini 2.0 Flash od Google. Każda persona obejmuje:

  • Dane demograficzne: przedział wiekowy, wykształcenie, funkcja zawodowa, wielkość firmy
  • Cele: co próbują osiągnąć (cele biznesowe, wyniki osobiste)
  • Punkty bólu: tarcia operacyjne, ograniczenia budżetowe, luki w możliwościach
  • Zapytania wyszukiwania: pytania, które zadają asystentom AI i wyszukiwarkom
  • Ukryte potrzeby: dorozumiane wymagania, których nie wyrażają w wyszukiwaniach, ujawnione dzięki analizie behawioralnej
  • Kontekst rynkowy: branża, presja konkurencyjna, środowisko regulacyjne
  • Wyzwalacze zakupowe: zdarzenia, które przenoszą je z fazy poszukiwań do fazy oceny

Zbiór danych jest przechowywany w formacie Parquet skompresowanym metodą ZSTD, co pozwala na sprawne ładowanie w pandas, Polars albo DuckDB. Rozkład branżowy jest zachowany z dokładnością do 0,2% oryginalnego zbioru, co oznacza, że próba stratyfikowana jest reprezentatywna statystycznie.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonimizacja: zahashowaliśmy wszystkie nazwy person do postaci Persona_{hash}, usunęliśmy narracyjne historie i wewnętrzne identyfikatory UUID. Zbiór danych ma jakość badawczą, bez danych osobowych.


Dlaczego 10%, a nie 100%?

Pełny zbiór 593 181 person to nasz produkt komercyjny. Zasila analitykę widoczności w AI dla zespołów marketingu B2B, które muszą zrozumieć, jak modele AI rekomendują ich markę albo jej nie rekomendują.

Opublikowaliśmy 10% (15 tys. person) z trzech strategicznych powodów:

1. Walidacja, a nie zastępstwo. 15 000 person wystarcza, żeby odtworzyć nasze badania, zweryfikować naszą metodologię i zbudować narzędzia proof-of-concept. To za mało, żeby zastąpić zbiór komercyjny. Jeśli trenujesz model rekomendacyjny albo budujesz wyszukiwarkę person, potrzebujesz pełnych 593 tys.

2. Darmowa próbka, która dowodzi jakości. Każdy badacz, który pobierze ten zbiór danych i zacytuje go w swojej pracy, potwierdza naszą metodologię. Każdy zespół danych, który oceni go pod kątem licencjonowania, na własnej skórze doświadcza głębi schematu. To generowanie popytu przy zerowym koszcie pozyskania klienta.

3. Autorytet akademicki kumuluje się. Publikacja na HuggingFace z cytowalnym DOI oznacza, że inni badacze odwołują się do tego zbioru danych. Te cytowania wzmacniają naszą pozycję: jeśli badasz persony generowane przez AI, modelowanie intencji zakupowych albo zachowania rekomendacyjne LLM, to jest kanoniczny zbiór danych.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Porównaj to z kampanią reklamową na LinkedIn za 2500 EUR. HuggingFace daje nam leady wyższej jakości, badaczy, data scientistów, korporacyjne zespoły ML, przy koszcie 0 EUR.


Dla kogo jest ten zbiór danych

Badacze studiujący zachowania AI, generowanie person albo modelowanie intencji zakupowych. To Twój zestaw treningowy do oceny, jak dobrze modele AI oddają rzeczywiste archetypy zakupowe.

Data scientiści budujący systemy rekomendacyjne, modele trafności wyszukiwania albo silniki personalizacji treści. Wykorzystaj go, żeby sprawdzić, czy Twój model potrafi przewidzieć, które persony zależą na których funkcjach.

Technolodzy marketingu oceniający narzędzia takie jak HubSpot, Salesforce Marketing Cloud albo SEMrush. Jeśli Twój dostawca deklaruje „wgląd w zachowania zakupowe napędzany przez AI”, teraz możesz porównać jego wyniki z opublikowanym zbiorem danych.

Zespoły produktowe w platformach martech albo sales intelligence. Jeśli rozważasz licencjonowanie pełnego zbioru danych do integracji OEM (50 tys.-200 tys. EUR rocznie), to Twój dowód wartości.

Laboratoria akademickie badające sprawiedliwość, uprzedzenia albo różnorodność person w zbiorach danych generowanych przez AI. Pełna publikacja zawiera analizę uprzedzeń w reprezentacji płci, wieku i branży.


Co możesz z niego zbudować

Zbudowaliśmy trzy otwarte narzędzia na bazie tego zbioru danych. Ty też możesz.

1. Persona Matcher Prześlij treści ze swojej strony albo opisy produktów. Narzędzie dopasuje Cię do person, które najbardziej rezonują ze zbioru danych, uszeregowanych według podobieństwa semantycznego. Traktuj to jak „znajdź moją grupę odbiorców” na podstawie tego, co AI odczytuje z sygnałów w Twoich treściach.

2. Benchmark Calculator Porównaj swoje pokrycie person z branżowymi konkurentami. Jeśli jesteś firmą B2B SaaS, jak wypada różnorodność Twoich odbiorców na tle mediany? Czy nadmiernie stawiasz na kupujących technicznych i pomijasz kupujących ekonomicznych?

3. AI Perception Readiness Index Oceń widoczność swojej marki w różnych modelach AI. Zbiór danych zasila punkt odniesienia: które persony są niedostatecznie obsługiwane przez obecne rekomendacje AI i gdzie leżą luki strategiczne?

Możesz odtworzyć te narzędzia, ulepszyć je albo zbudować coś zupełnie innego. Zbiór danych jest udostępniony na licencji Apache 2.0. Atrybucja wymagana, użycie komercyjne dozwolone.


Co oferuje pełny zbiór danych

Pełny zbiór 593 181 person zawiera wszystko, co jest w podzbiorze 15 tys., a dodatkowo:

  • 40 razy szersze pokrycie: 593 181 person z 339 branż (25 głównych wertykałów) z głębszą stratyfikacją podsegmentów
  • Śledzenie longitudinalne: ewolucja person w czasie w miarę kwartalnej regeneracji zbioru danych
  • Narracyjne historie: pełne narracje ścieżki zakupowej (usunięte z publicznego podzbioru na potrzeby anonimizacji)
  • Kontekst konkurencyjny: które persony wolą konkurentów i dlaczego
  • Dostęp przez API: odpytywanie person według branży, punktu bólu albo intencji wyszukiwania przez REST API
  • Licencjonowanie OEM: integracja white-label z Twoim produktem, z SLA i wsparciem

Pełny zbiór danych jest dostępny w ramach licencjonowania korporacyjnego (25 tys.-120 tys. EUR rocznie) albo subskrypcji API (od 2500 EUR miesięcznie). Skontaktuj się z nami pod adresem contact@rankfor.ai, żeby poznać cennik i uzyskać dostęp ewaluacyjny.


Jak korzystać z tego zbioru danych

Pobierz go z HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Załaduj go w Pythonie:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Zacytuj badanie: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link do publikacji]

Poznaj narzędzia: Wypróbuj Persona Matcher, Benchmark Calculator albo AI Perception Readiness Index, żeby zobaczyć, co możesz zbudować na danych o personach.


Dlaczego to ma znaczenie dla Twojej marki

Jeśli asystenci AI rekomendują rozwiązania Twoim potencjalnym klientom, musisz wiedzieć:

  1. Które persony zadają pytania, na które AI nie potrafi odpowiedzieć w Twojej kategorii (luki szans)
  2. Które persony AI rekomenduje Twoim konkurentom zamiast Tobie (podatność konkurencyjna)
  3. W które persony przeinwestowujesz treściami, które AI już faworyzuje (zmarnowany wysiłek)

Ten zbiór danych jest fundamentem tej analizy. Podzbiór 15 tys. dowodzi metodologii. Pełny zbiór 593 tys. zasila warstwę analityczną, która odpowiada na te pytania dla Twojej marki.

Pobierz zbiór danych. Buduj na jego podstawie. Jeśli potrzebujesz pełnego komercyjnego zbioru danych, dzieli nas jeden e-mail.


O Rankfor.AI: Pomagamy zespołom marketingu B2B zrozumieć ich widoczność w AI, czyli to, co modele AI wiedzą o ich marce, do których person docierają i gdzie w rozmowie dominują konkurenci. Nasza platforma jest zbudowana na największym opublikowanym zbiorze danych z personami zakupowymi generowanymi przez AI. Dowiedz się więcej na rankfor.ai.

Pobierz zbiór danych: HuggingFace Poznaj narzędzia: Persona Matcher | Benchmark Calculator | Readiness Score Licencjonuj pełny zbiór danych: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

Używamy plików cookie

Używamy niezbędnych plików cookie do działania strony. Za Twoją zgodą możemy również używać plików cookie analitycznych, aby zrozumieć, jak korzystasz z naszych narzędzi (takich jak Dice Roller), dzięki czemu możemy je ulepszać. Dowiedz się więcej