15.000 Buyer Personas veröffentlicht auf HuggingFace, um zu validieren, was die KI über die Wünsche Ihrer Kunden denkt, und warum wir nicht alle 593K veröffentlicht haben.
Warum wir diesen Datensatz veröffentlicht haben
Die meisten Datensätze mit Buyer Personas sind entweder synthetisches Rauschen oder hinter Enterprise-Paywalls verschlossen. Wir haben PersonaGen-15K auf HuggingFace veröffentlicht, um etwas anderes zu belegen: KI-generierte Personas sind keine Halluzinationen, sie sind ein Spiegel dessen, was KI-Modelle aus dem Web lernen.
Dies ist eine Teilmenge von 15.000 Personas aus unserem vollständigen Datensatz mit 593.181 Personas, eine historische 10-Prozent-Stichprobe aus der früheren Version mit 149K, veröffentlicht in Springers Zeitschrift Discover Artificial Intelligence. Sie ist nach Branchen geschichtet, anonymisiert und in einer einzigen 8,9 MB großen Parquet-Datei komprimiert. Der vollständige Datensatz bildet die Grundlage unserer kommerziellen Plattform für KI-Sichtbarkeitsintelligenz. Diese Teilmenge ist der Beweis dafür.
Wenn Sie Forscherin, Data Scientist oder Marketing-Technologin sind und sich fragen "Bilden KI-generierte Personas tatsächlich reales Kaufverhalten ab?", dann ist dies Ihr Validierungsdatensatz. Wenn Sie prüfen, ob Sie den vollständigen Datensatz für Ihr Produkt oder Ihre Forschung lizenzieren sollten, dann ist dies Ihre Qualitätsprüfung.
Sie können ihn hier herunterladen: PersonaGen-15K auf HuggingFace.
Was im Datensatz enthalten ist
PersonaGen-15K enthält 14.955 Buyer Personas aus 25 Branchen, generiert mit Google's Gemini 2.0 Flash. Jede Persona umfasst:
- Demografie: Altersspanne, Bildung, Funktion im Unternehmen, Unternehmensgröße
- Ziele: Was sie erreichen wollen (Geschäftsziele, persönliche Ergebnisse)
- Schmerzpunkte: Operative Reibung, Budgetbeschränkungen, Kompetenzlücken
- Suchanfragen: Die Fragen, die sie KI-Assistenten und Suchmaschinen stellen
- Aufgedeckte Bedürfnisse: Implizite Anforderungen, die in Suchanfragen nicht ausgesprochen, aber durch Verhaltensanalyse sichtbar werden
- Marktkontext: Branche, Wettbewerbsdruck, regulatorisches Umfeld
- Kaufauslöser: Ereignisse, die sie von der Recherche in die Bewertung überführen
Der Datensatz wird im ZSTD-komprimierten Parquet-Format gespeichert, um effizientes Laden in pandas, Polars oder DuckDB zu ermöglichen. Die Branchenverteilung bleibt innerhalb von 0,2 Prozent des Originaldatensatzes erhalten, was bedeutet, dass die geschichtete Stichprobe statistisch repräsentativ ist.
PersonaGen-15K: Dataset Composition
Anonymisierung: Wir haben alle Persona-Namen zu Persona_{hash} gehasht, narrative Geschichten entfernt und interne UUIDs gelöscht. Der Datensatz ist forschungstauglich, keine personenbezogenen Daten.
Warum 10 Prozent und nicht 100 Prozent?
Der vollständige Datensatz mit 593.181 Personas ist unser kommerzielles Produkt. Er treibt KI-Sichtbarkeitsintelligenz für B2B-Marketingteams an, die verstehen müssen, wie KI-Modelle ihre Marke empfehlen, oder eben nicht.
Wir haben 10 Prozent (15K Personas) aus drei strategischen Gründen veröffentlicht:
1. Validierung, kein Ersatz. 15.000 Personas reichen aus, um unsere Forschung zu reproduzieren, unsere Methodik zu validieren und Proof-of-Concept-Tools zu bauen. Sie reichen nicht aus, um den kommerziellen Datensatz zu ersetzen. Wenn Sie ein Empfehlungsmodell trainieren oder eine Persona-Suchmaschine bauen, benötigen Sie die vollständigen 593K.
2. Die kostenlose Stichprobe, die die Qualität belegt. Jede Forscherin, die diesen Datensatz herunterlädt und in ihrer Arbeit zitiert, validiert unsere Methodik. Jedes Datenteam, das ihn für eine Lizenzierung prüft, erlebt die Tiefe des Schemas. Das ist Nachfragegenerierung mit null Kundenakquisitionskosten.
3. Akademische Autorität summiert sich. Die Veröffentlichung auf HuggingFace mit einer zitierfähigen DOI bedeutet, dass andere Forscher auf diesen Datensatz verweisen. Diese Zitationen bekräftigen unsere Position: Wenn Sie KI-generierte Personas, die Modellierung von Kaufabsichten oder das Empfehlungsverhalten von LLMs untersuchen, dann ist dies der kanonische Datensatz.
Full Dataset vs Open Subset
Vergleichen Sie das mit einer LinkedIn-Werbekampagne für 2.500 EUR. HuggingFace liefert uns qualitativ hochwertigere Leads, Forscher, Data Scientists, Enterprise-ML-Teams, zu Kosten von 0 EUR.
Für wen dieser Datensatz gedacht ist
Forscherinnen und Forscher, die KI-Verhalten, Persona-Generierung oder die Modellierung von Kaufabsichten untersuchen. Dies ist Ihr Trainingsdatensatz, um zu bewerten, wie gut KI-Modelle reale Käuferarchetypen erfassen.
Data Scientists, die Empfehlungssysteme, Modelle für Suchrelevanz oder Engines zur Content-Personalisierung bauen. Nutzen Sie ihn, um zu testen, ob Ihr Modell vorhersagen kann, welche Personas sich für welche Funktionen interessieren.
Marketing-Technologen, die Tools wie HubSpot, Salesforce Marketing Cloud oder SEMrush bewerten. Wenn Ihr Anbieter mit "KI-gestützten Käufereinblicken" wirbt, können Sie dessen Ergebnisse nun an einem veröffentlichten Datensatz messen.
Produktteams bei Martech- oder Sales-Intelligence-Plattformen. Wenn Sie erwägen, den vollständigen Datensatz für die OEM-Integration zu lizenzieren (50K-200K EUR/Jahr), dann ist dies Ihr Proof-of-Value.
Akademische Labore, die Fairness, Verzerrung oder Persona-Diversität in KI-generierten Datensätzen erforschen. Das vollständige Paper enthält eine Verzerrungsanalyse über Geschlechter-, Alters- und Branchenrepräsentation hinweg.
Was Sie damit bauen können
Wir haben drei offene Tools mit diesem Datensatz gebaut. Das können Sie auch.
1. Persona Matcher Laden Sie Ihre Website-Inhalte oder Produktbeschreibungen hoch. Das Tool ordnet Ihnen die passendsten Personas im Datensatz zu, gerankt nach semantischer Ähnlichkeit. Stellen Sie es sich als "Finde mein Publikum" vor, basierend darauf, welche Signale die KI aus Ihren Inhalten liest.
2. Benchmark Calculator Vergleichen Sie Ihre Persona-Abdeckung mit Branchenkollegen. Wenn Sie ein B2B-SaaS-Unternehmen sind: Wie steht Ihre Zielgruppenvielfalt im Vergleich zum Median da? Übergewichten Sie technische Käufer und übersehen wirtschaftliche Entscheider?
3. AI Perception Readiness Index Bewerten Sie die Sichtbarkeit Ihrer Marke über KI-Modelle hinweg. Der Datensatz liefert die Basislinie: Welche Personas werden von aktuellen KI-Empfehlungen unterversorgt, und wo liegen die strategischen Lücken?
Sie können diese Tools nachbauen, verbessern oder etwas völlig anderes entwickeln. Der Datensatz steht unter der Apache-2.0-Lizenz. Namensnennung erforderlich, kommerzielle Nutzung erlaubt.
Was der vollständige Datensatz bietet
Der vollständige Datensatz mit 593.181 Personas enthält alles aus der 15K-Teilmenge, plus:
- 40-fache Abdeckung: 593.181 Personas über 339 Branchen (25 primäre Vertikalen) mit tieferer Schichtung nach Untersegmenten
- Längsschnittverfolgung: Persona-Entwicklung über die Zeit, während wir den Datensatz vierteljährlich neu generieren
- Narrative Geschichten: Vollständige Buyer-Journey-Erzählungen (für die Anonymisierung aus der öffentlichen Teilmenge entfernt)
- Wettbewerbskontext: Welche Personas Wettbewerber bevorzugen und warum
- API-Zugriff: Personas nach Branche, Schmerzpunkt oder Suchabsicht über eine REST-API abfragen
- OEM-Lizenzierung: White-Label-Integration in Ihr Produkt, mit SLA und Support
Der vollständige Datensatz ist über Enterprise-Lizenzierung (25K-120K EUR/Jahr) oder API-Abonnements (ab 2.500 EUR/Monat) verfügbar. Kontaktieren Sie uns unter contact@rankfor.ai für Preise und Zugang zur Evaluierung.
So verwenden Sie diesen Datensatz
Laden Sie ihn von HuggingFace herunter: https://huggingface.co/datasets/Rankfor/PersonaGen-15K
Laden Sie ihn in Python:
import pandas as pd
df = pd.read_parquet('hf://datasets/Rankfor/PersonaGen-15K/personagen-15k.parquet')
print(df.head())
Zitieren Sie die Forschung: Żatuchin, D. (2025). PersonaGen-593K: A Large-Scale Dataset of AI-Generated Buyer Personas for Studying LLM Recommendation Behavior. Discover Artificial Intelligence. [Link zum Paper]
Entdecken Sie die Tools: Probieren Sie den Persona Matcher, den Benchmark Calculator oder den AI Perception Readiness Index aus, um zu sehen, was Sie mit Persona-Daten bauen können.
Warum das für Ihre Marke wichtig ist
Wenn KI-Assistenten Ihren potenziellen Kunden Lösungen empfehlen, müssen Sie wissen:
- Welche Personas Fragen zu Ihrer Kategorie stellen, die die KI nicht beantworten kann (Chancenlücken)
- Welche Personas die KI Ihren Wettbewerbern statt Ihnen empfiehlt (Wettbewerbsanfälligkeit)
- In welche Personas Sie mit Inhalten überinvestieren, die die KI ohnehin schon bevorzugt (verschwendeter Aufwand)
Dieser Datensatz ist die Grundlage dieser Analyse. Die 15K-Teilmenge belegt die Methodik. Der vollständige 593K-Datensatz treibt die Intelligenzebene an, die diese Fragen für Ihre Marke beantwortet.
Laden Sie den Datensatz herunter. Bauen Sie damit. Wenn Sie den vollständigen kommerziellen Datensatz benötigen, sind wir nur eine E-Mail entfernt.
Über Rankfor.AI: Wir helfen B2B-Marketingteams, ihre KI-Sichtbarkeit zu verstehen: was KI-Modelle über ihre Marke wissen, welche Personas sie erreichen und wo Wettbewerber das Gespräch dominieren. Unsere Plattform baut auf dem größten veröffentlichten Datensatz KI-generierter Buyer Personas auf. Mehr erfahren Sie unter rankfor.ai.
Datensatz herunterladen: HuggingFace Tools entdecken: Persona Matcher | Benchmark Calculator | Readiness Score Vollständigen Datensatz lizenzieren: contact@rankfor.ai
