article

PersonaGen-15K: il primo dataset aperto di buyer persona generate dall'AI

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15.000 buyer persona pubblicate su HuggingFace per validare cosa l'AI pensa che vogliano i tuoi clienti, e perché non abbiamo pubblicato tutte le 593K.


Perché abbiamo pubblicato questo dataset

La maggior parte dei dataset di buyer persona è rumore sintetico oppure resta chiusa dietro paywall enterprise. Abbiamo pubblicato PersonaGen-15K su HuggingFace per dimostrare un punto diverso: le persona generate dall'AI non sono allucinazioni, sono un riflesso di ciò che i modelli AI imparano dal web.

Questo è un sottoinsieme di 15.000 persona tratto dal nostro dataset completo di 593.181 persona, un campione storico del 10% della precedente versione da 149K, pubblicato sulla rivista Discover Artificial Intelligence di Springer. È stratificato per settore, anonimizzato e compresso in un unico file Parquet da 8,9 MB. Il dataset completo è la base della nostra piattaforma commerciale di intelligence sulla visibilità AI. Questo sottoinsieme ne è la prova.

Se sei un ricercatore, un data scientist o un tecnologo del marketing che si chiede "le persona generate dall'AI corrispondono davvero al comportamento reale degli acquirenti?", questo è il tuo set di validazione. Se stai valutando se ottenere in licenza il dataset completo per il tuo prodotto o la tua ricerca, questo è il tuo controllo di qualità.

Puoi scaricarlo qui: PersonaGen-15K su HuggingFace.


Cosa contiene il dataset

PersonaGen-15K contiene 14.955 buyer persona in 25 settori, generate usando Gemini 2.0 Flash di Google. Ogni persona include:

  • Dati demografici: fascia d'età, istruzione, funzione lavorativa, dimensione dell'azienda
  • Obiettivi: ciò che stanno cercando di ottenere (obiettivi di business, risultati personali)
  • Punti critici: attriti operativi, vincoli di budget, lacune nelle capacità
  • Query di ricerca: le domande che pongono agli assistenti AI e ai motori di ricerca
  • Bisogni non espressi: requisiti impliciti non dichiarati nelle ricerche ma rivelati dall'analisi comportamentale
  • Contesto di mercato: settore, pressioni competitive, contesto normativo
  • Trigger d'acquisto: eventi che li spostano dalla ricerca alla valutazione

Il dataset è archiviato in formato Parquet compresso con ZSTD per un caricamento efficiente in pandas, Polars o DuckDB. La distribuzione per settore è preservata entro lo 0,2% del dataset originale, il che significa che il campione stratificato è statisticamente rappresentativo.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonimizzazione: abbiamo trasformato in hash tutti i nomi delle persona in Persona_{hash}, rimosso le storie narrative ed eliminato gli UUID interni. Il dataset è di livello ricerca, non contiene dati personali.


Perché il 10% e non il 100%?

Il dataset completo di 593.181 persona è il nostro prodotto commerciale. Alimenta l'intelligence sulla visibilità AI per i team di marketing B2B che hanno bisogno di capire come i modelli AI raccomandano il loro brand, oppure non lo fanno.

Abbiamo pubblicato il 10% (15K persona) per tre ragioni strategiche:

1. Validazione, non sostituzione. 15.000 persona sono sufficienti per riprodurre la nostra ricerca, validare la nostra metodologia e costruire strumenti proof-of-concept. Non sono sufficienti per sostituire il dataset commerciale. Se stai addestrando un modello di raccomandazione o costruendo un motore di ricerca di persona, hai bisogno delle 593K complete.

2. Il campione gratuito che dimostra la qualità. Ogni ricercatore che scarica questo dataset e lo cita nel proprio lavoro sta validando la nostra metodologia. Ogni team di dati che lo valuta per la licenza sta sperimentando la profondità dello schema. Questa è generazione di domanda con costo di acquisizione clienti pari a zero.

3. L'autorità accademica si accumula nel tempo. Pubblicare su HuggingFace con un DOI citabile significa che altri ricercatori fanno riferimento a questo dataset. Quelle citazioni rafforzano la nostra posizione: se stai studiando le persona generate dall'AI, la modellazione dell'intento d'acquisto o il comportamento di raccomandazione degli LLM, questo è il dataset di riferimento.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Confrontalo con una campagna pubblicitaria LinkedIn da 2.500 EUR. HuggingFace ci porta lead di qualità superiore, ricercatori, data scientist, team ML enterprise, a costo zero EUR.


A chi è rivolto questo dataset

Ricercatori che studiano il comportamento dell'AI, la generazione di persona o la modellazione dell'intento d'acquisto. Questo è il tuo training set per valutare quanto bene i modelli AI catturano gli archetipi reali degli acquirenti.

Data scientist che costruiscono sistemi di raccomandazione, modelli di rilevanza per la ricerca o motori di personalizzazione dei contenuti. Usalo per verificare se il tuo modello riesce a prevedere quali persona sono interessate a quali funzionalità.

Tecnologi del marketing che valutano strumenti come HubSpot, Salesforce Marketing Cloud o SEMrush. Se il tuo fornitore afferma di offrire "insight sugli acquirenti basati sull'AI", ora puoi confrontare i suoi output con un dataset pubblicato.

Team di prodotto presso piattaforme martech o di sales intelligence. Se stai valutando la licenza del dataset completo per un'integrazione OEM (50K-200K EUR/anno), questa è la tua prova di valore.

Laboratori accademici che studiano equità, bias o diversità delle persona nei dataset generati dall'AI. Il paper completo include un'analisi dei bias per genere, età e rappresentazione settoriale.


Cosa puoi costruire con esso

Abbiamo costruito tre strumenti aperti usando questo dataset. Puoi farlo anche tu.

1. Persona Matcher Carica i contenuti del tuo sito web o le descrizioni dei tuoi prodotti. Lo strumento ti abbina alle persona più affini nel dataset, ordinate per somiglianza semantica. Pensalo come un "trova il mio pubblico" basato su ciò che l'AI percepisce dai segnali dei tuoi contenuti.

2. Benchmark Calculator Confronta la tua copertura di persona con quella dei tuoi pari di settore. Se sei un'azienda SaaS B2B, quanto è diversificato il tuo pubblico rispetto alla mediana? Stai puntando troppo sugli acquirenti tecnici trascurando quelli economici?

3. AI Perception Readiness Index Valuta la visibilità del tuo brand nei modelli AI. Il dataset alimenta il riferimento di base: quali persona sono poco servite dalle attuali raccomandazioni AI, e dove si trovano le lacune strategiche?

Puoi replicare questi strumenti, migliorarli o costruire qualcosa di completamente diverso. Il dataset è rilasciato sotto licenza Apache 2.0. Attribuzione richiesta, uso commerciale consentito.


Cosa offre il dataset completo

Il dataset completo di 593.181 persona include tutto ciò che è presente nel sottoinsieme da 15K, più:

  • 40 volte più copertura: 593.181 persona in 339 settori (25 verticali principali) con una stratificazione dei sotto-segmenti più approfondita
  • Tracciamento longitudinale: l'evoluzione delle persona nel tempo, poiché rigeneriamo il dataset ogni trimestre
  • Storie narrative: narrazioni complete del percorso d'acquisto (rimosse dal sottoinsieme pubblico per l'anonimizzazione)
  • Contesto competitivo: quali persona preferiscono i concorrenti, e perché
  • Accesso API: interroga le persona per settore, punto critico o intento di ricerca tramite REST API
  • Licenza OEM: integrazione white-label nel tuo prodotto, con SLA e supporto

Il dataset completo è disponibile tramite licenza enterprise (25K-120K EUR/anno) o abbonamenti API (a partire da 2.500 EUR/mese). Contattaci all'indirizzo contact@rankfor.ai per prezzi e accesso di valutazione.


Come usare questo dataset

Scaricalo da HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Caricalo in Python:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Cita la ricerca: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]

Esplora gli strumenti: prova il Persona Matcher, il Benchmark Calculator o l'AI Perception Readiness Index per vedere cosa puoi costruire con i dati sulle persona.


Perché questo è importante per il tuo brand

Se gli assistenti AI stanno raccomandando soluzioni ai tuoi potenziali clienti, devi sapere:

  1. Quali persona pongono all'AI domande sulla tua categoria a cui non sa rispondere (lacune di opportunità)
  2. Quali persona l'AI raccomanda ai tuoi concorrenti invece che a te (vulnerabilità competitiva)
  3. Su quali persona stai investendo troppo con contenuti che l'AI già favorisce (sforzo sprecato)

Questo dataset è la base di quell'analisi. Il sottoinsieme da 15K dimostra la metodologia. Il dataset completo da 593K alimenta il livello di intelligence che risponde a queste domande per il tuo brand.

Scarica il dataset. Costruisci con esso. Se hai bisogno del dataset commerciale completo, siamo a un'email di distanza.


Su Rankfor.AI: aiutiamo i team di marketing B2B a capire la loro visibilità AI: cosa i modelli AI sanno del loro brand, quali persona raggiungono e dove i concorrenti dominano la conversazione. La nostra piattaforma è costruita sul più grande dataset pubblicato di buyer persona generate dall'AI. Scopri di più su rankfor.ai.

Scarica il dataset: HuggingFace Esplora gli strumenti: Persona Matcher | Benchmark Calculator | Readiness Score Ottieni la licenza del dataset completo: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Tutti i diritti riservati.

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Utilizziamo i cookie

Utilizziamo cookie essenziali per far funzionare il nostro sito. Con il suo consenso, potremmo anche utilizzare cookie di analisi per comprendere come utilizza i nostri strumenti (come il Dice Roller) in modo da poterli migliorare. Scopri di più