article

PersonaGen-15K: O Primeiro Dataset Aberto de Buyer Personas Geradas por IA

February 15, 2026
8 min read
Dmitrij Żatuchin
HuggingFaceOpen DataPersonaGen-15KBuyer PersonasAI DatasetApache 2.0Research

15.000 buyer personas publicadas no HuggingFace para validar o que a IA acha que seus clientes querem, e por que não publicamos todas as 593K.


Por Que Publicamos Este Dataset

A maioria dos datasets de buyer personas ou é ruído sintético ou está trancada atrás de paywalls corporativos. Publicamos o PersonaGen-15K no HuggingFace para provar um ponto diferente: personas geradas por IA são um reflexo do que os modelos de IA aprendem com a web, e não alucinações.

Este é um subconjunto de 15.000 personas do nosso dataset completo de 593.181 personas, uma amostra histórica de 10% da versão anterior de 149K, publicada na revista Discover Artificial Intelligence da Springer. É estratificado por setor, anonimizado e comprimido em um único arquivo Parquet de 8,9 MB. O dataset completo é a base da nossa plataforma comercial de inteligência de visibilidade em IA. Este subconjunto é a prova.

Se você é pesquisador, cientista de dados ou tecnólogo de marketing perguntando "as personas geradas por IA realmente mapeiam o comportamento real do comprador?", este é o seu conjunto de validação. Se você está avaliando licenciar o dataset completo para o seu produto ou pesquisa, este é o seu teste de qualidade.

Você pode baixá-lo aqui: PersonaGen-15K no HuggingFace.


O Que Há Dentro do Dataset

O PersonaGen-15K contém 14.955 buyer personas em 25 setores, geradas com o Gemini 2.0 Flash do Google. Cada persona inclui:

  • Dados demográficos: Faixa etária, escolaridade, função profissional, porte da empresa
  • Objetivos: O que estão tentando alcançar (metas de negócio, resultados pessoais)
  • Pontos de dor: Atrito operacional, restrições de orçamento, lacunas de capacidade
  • Consultas de busca: As perguntas que fazem a assistentes de IA e mecanismos de busca
  • Necessidades não descobertas: Requisitos implícitos que não aparecem nas buscas, mas se revelam pela análise comportamental
  • Contexto de mercado: Setor, pressões competitivas, ambiente regulatório
  • Gatilhos de compra: Eventos que os movem da pesquisa para a avaliação

O dataset é armazenado em formato Parquet comprimido com ZSTD para carregamento eficiente em pandas, Polars ou DuckDB. A distribuição por setor é preservada dentro de 0,2% do dataset original, o que significa que a amostra estratificada é estatisticamente representativa.

PersonaGen-15K: Dataset Composition

14,95574,40044,90045,00074,10025PersonasSearch QueriesPain PointsGoalsInformation NeedsIndustries010k20k30k40k50k60k70k

Anonimização: Convertemos todos os nomes de persona em hash para Persona_{hash}, removemos histórias narrativas e eliminamos UUIDs internos. O dataset é de nível de pesquisa, sem PII.


Por Que 10%, e Não 100%?

O dataset completo de 593.181 personas é o nosso produto comercial. Ele alimenta a inteligência de visibilidade em IA para equipes de marketing B2B que precisam entender como os modelos de IA recomendam a sua marca, ou não.

Publicamos 10% (15K personas) por três razões estratégicas:

1. Validação, não substituição. 15.000 personas são suficientes para reproduzir nossa pesquisa, validar nossa metodologia e construir ferramentas de prova de conceito. Não são suficientes para substituir o dataset comercial. Se você está treinando um modelo de recomendação ou construindo um mecanismo de busca de personas, precisa do dataset completo de 593K.

2. A amostra gratuita que prova a qualidade. Cada pesquisador que baixa este dataset e o cita em seu trabalho valida nossa metodologia. Cada equipe de dados que o avalia para licenciamento experimenta a profundidade do schema. Isto é geração de demanda com custo zero de aquisição de clientes.

3. Autoridade acadêmica se acumula. Publicar no HuggingFace com um DOI citável significa que outros pesquisadores referenciam este dataset. Essas citações reforçam nossa posição: se você estuda personas geradas por IA, modelagem de intenção do comprador ou comportamento de recomendação de LLMs, este é o dataset canônico.

Full Dataset vs Open Subset

593,18114,955Full Dataset (593K)Open Subset (15K)0100k200k300k400k500k600k

Compare isso com uma campanha de anúncios no LinkedIn de EUR 2.500. O HuggingFace nos dá leads de maior qualidade, pesquisadores, cientistas de dados, equipes de ML corporativas, a um custo de EUR 0.


Para Quem Este Dataset Foi Feito

Pesquisadores que estudam comportamento de IA, geração de personas ou modelagem de intenção do comprador. Este é o seu conjunto de treinamento para avaliar quão bem os modelos de IA capturam arquétipos de compradores do mundo real.

Cientistas de dados que constroem sistemas de recomendação, modelos de relevância de busca ou mecanismos de personalização de conteúdo. Use-o para testar se o seu modelo consegue prever quais personas se importam com quais funcionalidades.

Tecnólogos de marketing que avaliam ferramentas como HubSpot, Salesforce Marketing Cloud ou SEMrush. Se o seu fornecedor afirma ter "insights de compradores com IA", agora você pode comparar os resultados dele com um dataset publicado.

Equipes de produto em plataformas de martech ou inteligência de vendas. Se você está considerando licenciar o dataset completo para integração OEM (EUR 50K-200K/ano), esta é a sua prova de valor.

Laboratórios acadêmicos que pesquisam justiça, viés ou diversidade de personas em datasets gerados por IA. O artigo completo inclui análise de viés por gênero, idade e representação setorial.


O Que Você Pode Construir Com Ele

Construímos três ferramentas abertas usando este dataset. Você também pode.

1. Persona Matcher Envie o conteúdo do seu site ou descrições de produtos. A ferramenta faz o pareamento com as personas mais alinhadas do dataset, classificadas por similaridade semântica. Pense nisso como "encontre meu público" com base no que a IA acha que seu conteúdo sinaliza.

2. Benchmark Calculator Compare a cobertura de personas da sua empresa com a de pares do setor. Se você é uma empresa de SaaS B2B, como a diversidade do seu público se compara à mediana? Você está sobrecarregando compradores técnicos e deixando de lado compradores econômicos?

3. AI Perception Readiness Index Pontue a visibilidade da sua marca nos modelos de IA. O dataset alimenta a linha de base: quais personas são mal atendidas pelas recomendações atuais de IA e onde estão as lacunas estratégicas?

Você pode replicar essas ferramentas, aprimorá-las ou construir algo totalmente diferente. O dataset é licenciado sob Apache 2.0. Atribuição obrigatória, uso comercial permitido.


O Que o Dataset Completo Oferece

O dataset completo de 593.181 personas inclui tudo o que há no subconjunto de 15K, além de:

  • 40x mais cobertura: 593.181 personas em 339 setores (25 verticais principais) com estratificação mais profunda por subsegmento
  • Rastreamento longitudinal: A evolução das personas ao longo do tempo, à medida que regeramos o dataset trimestralmente
  • Histórias narrativas: Narrativas completas da jornada de compra (removidas do subconjunto público para anonimização)
  • Contexto competitivo: Quais personas preferem concorrentes e por quê
  • Acesso via API: Consulte personas por setor, ponto de dor ou intenção de busca através de uma API REST
  • Licenciamento OEM: Integração white-label ao seu produto, com SLA e suporte

O dataset completo está disponível por meio de licenciamento corporativo (EUR 25K-120K/ano) ou assinaturas de API (a partir de EUR 2.500/mês). Fale conosco em contact@rankfor.ai para preços e acesso de avaliação.


Como Usar Este Dataset

Baixe-o do HuggingFace: https://huggingface.co/datasets/Rankfor/PersonaGen-15K

Carregue-o em Python:

import pandas as pd

df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())

Cite a pesquisa: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link to paper]

Explore as ferramentas: Experimente o Persona Matcher, o Benchmark Calculator ou o AI Perception Readiness Index para ver o que você pode construir com dados de personas.


Por Que Isso Importa Para a Sua Marca

Se os assistentes de IA estão recomendando soluções aos seus clientes potenciais, você precisa saber:

  1. Quais personas fazem perguntas que a IA não consegue responder sobre a sua categoria (lacunas de oportunidade)
  2. Quais personas a IA recomenda aos seus concorrentes em vez de você (vulnerabilidade competitiva)
  3. Em quais personas você está investindo demais com conteúdo que a IA já favorece (esforço desperdiçado)

Este dataset é a base dessa análise. O subconjunto de 15K prova a metodologia. O dataset completo de 593K alimenta a camada de inteligência que responde a essas perguntas para a sua marca.

Baixe o dataset. Construa com ele. Se você precisar do dataset comercial completo, estamos a um e-mail de distância.


Sobre a Rankfor.AI: Ajudamos equipes de marketing B2B a entender sua visibilidade em IA: o que os modelos de IA sabem sobre a marca delas, quais personas elas alcançam e onde os concorrentes dominam a conversa. Nossa plataforma é construída sobre o maior dataset publicado de buyer personas geradas por IA. Saiba mais em rankfor.ai.

Baixe o dataset: HuggingFace Explore as ferramentas: Persona Matcher | Benchmark Calculator | Readiness Score Licencie o dataset completo: contact@rankfor.ai

People Also Ask

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

Usamos cookies

Usamos cookies essenciais para fazer nosso site funcionar. Com o seu consentimento, também podemos usar cookies analíticos para entender como você usa nossas ferramentas (como o Dice Roller) para que possamos melhorá-las. Saiba mais