Workflow

Show how unstable the AI answer really is

Roll one question ten times, see which brands hold across every answer and which flicker, then hand finance the PDF.

Experte
5 minutes
Marketing Manager, Marketing Director, Content Strategist
Dieses Playbook auf dem Bildschirm, von Anfang bis Ende.Video in neuem Tab öffnen

Hook: Werfen Sie eine Käuferfrage zehnmal und geben Sie der Finanzabteilung dann das Stabilitäts-PDF. Diese eine Frage von Hand auszuzählen kostet EUR 135 bis EUR 270 Analystenzeit.

Was Sie danach können

  • Eine Käuferfrage zehnmal gegen ein Modell werfen und die zehn Antworten nebeneinander lesen
  • Jede Marke, die das Modell genannt hat, danach in vier Stufen sortieren, wie viele Würfe sie genannt haben, und diese Lücke auf eine Folie bringen
  • Die Zeilen, zu denen das Modell in jedem Wurf zurückkehrte, von denen trennen, die es einmal sagte
  • Alle zehn Antworten vollständig lesen, dazu die Seiten, die jede verankerte Antwort zitiert hat
  • Den Bericht als dice-roller-report-<timestamp>.pdf oder .md für die Budgetsitzung exportieren

Laufzeit: 4:44 | Schwierigkeit: Fortgeschritten

Sie bitten um Budget dafür, in KI-Antworten sichtbar zu sein, und die Führung hört die Bitte und stellt sich ein Suchranking vor: eine feste Liste, die hält, bis jemand sie ändert. Der Antrag stirbt in der Sitzung, in der eine Kollegin ChatGPT auf dem Handy öffnet, Ihre Kategoriefrage einmal tippt, Ihre Marke in der Antwort sieht und entscheidet, das ganze Problem sei eingebildet. Ein Wurf beweist in keine Richtung etwas. Zehn Würfe derselben Frage gegen dasselbe Modell geben zehn verschiedene Listen, und die Form dieser Streuung ist das Argument. Ihr Wettbewerber hält die Antwort, egal wie sie formuliert ist; Sie tauchen in sechs Würfen auf und verschwinden in vier. Diese Lücke ist eine Zahl, sobald jemand sie zählt.

Was es heute kostet

Annahme: eine Analystin zu EUR 90 pro Stunde. Zehn frische Chats, dieselbe Frage zehnmal eingefügt, zehn Antworten gespeichert, dann eine Auszählung, wer genannt wurde und wo.

Arbeit, von HandZeitKosten zu EUR 90/h
Eine Frage, zehn Würfe1.5 bis 3 hEUR 135 bis EUR 270
Ein Satz von zehn Fragen15 bis 30 hEUR 1,350 bis EUR 2,700

Die Methode driftet außerdem. Die nächste Analystin zählt Satzwiederholungen anders, diese Prüfung und die letzte sind also zwei Messungen mit demselben Etikett.

Diese Tabelle bepreist das Fragen und das Auszählen, also die Arbeit, die ein Team tatsächlich macht. Der Schritt, den sie auslässt, ist der, der die Zahl erzeugt. Zehn Antworten enthalten Dutzende einzelner Aussagen, und die Frage, die Geld wert ist, lautet, welche davon das Modell in jedem Wurf wiederholt und welche es einmal sagt. Von Hand können Sie nur Formulierungen abgleichen, "wir sind die günstigsten" und "niemand unterbietet uns" landen also in zwei verschiedenen Zeilen. Rankfor.AI vergleicht die Aussagen nach Bedeutung, legt die inhaltsgleichen in eine einzige Zeile und teilt diese Zeilen dann danach auf, wie viele Würfe sie überstanden haben. Gegen diese Position steht kein Stundensatz, weil fast niemand den Tag einplant, den sie brauchen würde.

Dice Roller sitzt auf Strategist zu EUR 496 im Monat. Zu EUR 270 pro Frage ist der Plan bei der zweiten Frage gedeckt (2 x 270 = 540). Zu EUR 135 pro Frage braucht es vier (4 x 135 = 540).

Was das Video zeigt

  1. Dice Roller öffnet sich unter "Tools" in der Einstellung "Stability roll". Eine Karte enthält den ganzen Lauf: die Frage, Ihren Markennamen und einen Schieberegler dafür, wie oft gefragt wird.
  2. Das Setup geht hinein. Tippen Sie die Käuferfrage so, wie ein Kunde sie tippen würde, tragen Sie Ihren Markennamen ein, damit jede Erwähnung gezählt wird, ziehen Sie den Regler von 3 auf 10, wählen Sie "Search mode" und starten Sie.
  3. Drei Karten öffnen die Ergebnisseite: Consistency Score, Semantic Overlap, Zahl der Würfe, darunter die Sentiment-Aufteilung über alle zehn Antworten.
  4. Das Markenpanel sortiert jeden Namen, nach dem das Modell gegriffen hat, in vier Stufen danach, wie viele der zehn Würfe ihn genannt haben: "Always" ab 80 % der Würfe, "Frequent" ab 50, "Occasional" ab 20, "Rare" darunter.
  5. Schalten Sie dieses Panel auf "Table", und die ganze Liste kommt mit Zahlen daneben. Ein Wettbewerber in "Always" gegen Ihren eigenen Namen in "Occasional" ist die Folie.
  6. "Message Stability" teilt die Sätze auf: die, die das Modell jedes Mal sagt, die, die es variiert, die, die einmal auftauchten. Zeilen werden nach Bedeutung gruppiert, ein dreifach anders formulierter Punkt landet also in einer Zeile.
  7. "Responses" hält alle zehn Antworten vollständig, nichts wegzusammengefasst, mit Markennamen in ihrer Stufenfarbe im Text hervorgehoben.
  8. "Sources" listet jede zitierte Seite, wie viele Würfe sie gespeist hat, und einen Klick zurück zu der Antwort, die sie erzeugt hat. Diesen Tab gibt es, weil der Lauf im "Search mode" lief.
  9. "Export" schreibt das PDF, und das Schlussbild legt es der Finanzabteilung vor.

Was Sie brauchen

  • Strategist, EUR 496 im Monat, oder Enterprise.
  • Ein Projekt mit abgeschlossenem Scan. Ohne einen schickt der Startknopf nichts ab.
  • Das Modell auf Gemini, ChatGPT oder Grok gesetzt, bevor Sie beginnen. Ein Wechsel mitten im Lauf leert das Formular.
  • "Search mode" für die Quellenliste. "Memory mode" hat überhaupt keinen Sources-Tab.
  • Zeit. Zehn Würfe sind das langsame Ende des Reglers, starten Sie den Lauf also am Tag, bevor Sie die Antwort brauchen.
  • Ein Dice Roller-Lauf zur Zeit pro Scan.

Fragen, die Leute stellen

Wie viele Würfe kann ich anfordern? Zehn. Der Regler endet dort, das misst also Wiederholung über zehn Antworten und behauptet nichts darüber hinaus.

Welche KI antwortet? Gemini, ChatGPT oder Grok. Ein Lauf fragt ein Modell, nämlich das auf Ihrem Projekt eingestellte, ein Bild über drei Modelle heißt also drei Läufe.

Ist der Consistency Score statistisch signifikant? Nein. Beide Werte auf dieser Seite sind gewichtete Mischwerte zwischen 0 und 1, angezeigt als Prozentzahlen. Das Argument, das Sie in den Vorstand tragen, ist die Stufenlücke und die zehn Antworten darunter.

Beobachtet es die Frage weiter für mich? Nein. Jeder Lauf ist ein manueller Klick. Es gibt keinen Zeitplan und keine Benachrichtigung, einen monatlichen Rhythmus tragen Sie sich also selbst in den Kalender.

Werfen Sie die Frage, die Ihr Vorstand tippen würde, und legen Sie dann die vier Stufen auf eine Folie.

Topics

Video WalkthroughStability AnalysisDice RollResponse ConsistencyCore Messages

Führen Sie das für Ihre eigene Marke aus

Rankfor.AI erledigt diese Aufgabe regelmäßig, für Ihre Marke und die Ihrer Kunden.

Wir verwenden Cookies

Wir verwenden notwendige Cookies, damit unsere Website funktioniert. Mit Ihrer Zustimmung können wir auch Analyse-Cookies verwenden, um zu verstehen, wie Sie unsere Tools (wie den Dice Roller) nutzen, damit wir sie verbessern können. Mehr erfahren