Key Findings
- AI platforms agree on brand recommendations only 14% of the time
- Gemini changed from 14 to 3.7 brands in one afternoon -- 74% drop
- GPT-5.2 refused to name brands in 70% of responses
- Only 4 brands (Apple, Sony, Bose, Patagonia) visible across all 3 platforms
- Gender-framed queries produced 33-61% fewer brand recommendations for "wife"
AI-platforme er enige om, hvilke brands der skal anbefales, kun 14% af tiden. Enhver AI visibility-rapport, der ikke måler konsistens, måler tilfældighed.
Det problem, som ingen taler om
Du investerede i overvågning af "AI visibility". Du kørte en rapport. ChatGPT nævnte dit brand. Sejr, eller hvad?
Nej.
Vi stillede samme spørgsmål til tre større AI-platforme 239 gange. Resultaterne burde få enhver marketer, der er afhængig af AI visibility-data, til at være bekymret.
Gemini ændrede sine brand-anbefalinger 4 gange på 2 timer. I ét kørsel nævnte det 14 brands. To timer senere gav samme forespørgsel i gennemsnit 3,7 brands. Det er et fald på 74% uden ændringer i dit indhold, din SEO eller dine konkurrenter.
GPT-5.2 nægtede at nævne brands 70% af tiden. Verdens mest populære AI-assistent undgår bevidst produktanbefalinger. Hvis din AI visibility-strategi fokuserer på ChatGPT, optimerer du for en platform, der aktivt modstår brand-omtaler.
Kun 4 brands ud af 64 blev nævnt af alle tre platforme. Apple, Sony, Bose og Patagonia. Alle andre? Platform-specifikke vindere og tabere, der ændrer sig med hver forespørgsel.
Dette er ikke et måleproblem, du kan ignorere. Det er fundamentet for din AI visibility-strategi, der styrtdykker under dig.
Hvad vores forskning faktisk målte
Vi gennemførte 239 forespørgsler på tværs af tre prompts (gaveanbefaling til mand, kone og generisk 2025) og tre platforme (Gemini, GPT-5.2, Grok). I stedet for at køre én forespørgsel og kalde det data, kørte vi flere iterationer for at måle, hvad AI faktisk mener, i forhold til hvad det tilfældigvis sagde én gang.
De fund, der burde ændre din tankegang om AI visibility
Model Consistency Comparison
Higher consistency = more predictable brand visibility. Grok shows the most reliable behavior for brand recommendations.
Source: Cross-Model Response Stability Analysis (n=239 samples, Dec 2025)
Grok giver samme svar 77% af tiden. Hvis du har brug for forudsigelig brand visibility, er Grok i øjeblikket den mest pålidelige platform. Men "pålidelig" kommer med et forbehold: Amazon vises i 95% af Groks gaveanbefalinger til mand. Pålidelighed kan også betyde platform-specifik bias, der måske ikke favoriserer dit brand.
Gemini ændrer mening konstant. Med en konsistensscore på blot 48% er Geminis anbefalinger i det væsentlige et terningekast. Vores forskning fangede en enkelt eftermiddag, hvor det gennemsnitlige antal brand-omtaler pr. forespørgsel faldt fra 14,0 til 3,7 og derefter steg til 13,1. Ingen eksterne ændringer. Blot AI-ustabilitet.
Gemini Temporal Instability (Dec 29-30, 2025)
Gemini's brand recommendations collapsed from 14.0 to 3.7 average brands within 65 minutes (74% drop), then recovered. This demonstrates why single-query measurements are unreliable.
Four consecutive runs of 10 iterations each. Same prompt, same model, same configuration. 74% variance between Run 1 and Run 2 suggests model updates or A/B testing.
GPT-5.2 undgår bevidst at nævne brands. Dette er ikke variation. Dette er design. 70% af ChatGPT-svar indeholdt nul brand-omtaler. OpenAIs mest avancerede model foretrækker vejledning på kategoriniveau ("søg efter ure med sapphire krystal") frem for specifikke anbefalinger. Hvis dine konkurrenter heller ikke vises, er det ikke en konkurrencemæssig fordel. Det er gensidig usynlighed.
Tværs-platform-enighed er næsten ikke-eksisterende. Jaccard-indekset (et mål for overlap mellem sæt) for brand-anbefalinger på tværs af platforme varierer fra 5,6% til 55,4%. Oversættelse: AI-platforme anbefaler forskellige brands til samme forespørgsel mere end 80% af tiden.
Cross-Model Brand Overlap (Husband Query)
Only 4 brands (Apple, Sony, Bose, Patagonia) mentioned by all three models. This means platforms disagree on 86% of brand recommendations.
Jaccard similarity index measures brand set overlap (0 = no overlap, 1 = perfect overlap). Gemini ↔ Grok show moderate agreement (0.68), but both have extremely low agreement with OpenAI (0.14-0.18).
De data, der betyder noget
Her er hvad vi fandt, når vi holdt op med at måle øjebliksbilleder og begyndte at måle stabilitet:
-
Grok konsistens: 77% - Giver samme svar 77% af tiden. Mest pålidelig til brand-planlægning.
-
Gemini konsistens: 48% - Ændret fra 14 brands til 3,7 brands på én eftermiddag. Enkelte forespørgsler er meningsløse.
-
GPT-5.2 brand-omtaler: 0,63 pr. forespørgsel - 70% af svarene havde nul brands. Ved design, ikke tilfældigvis.
-
Tværs-platform-enighed: 14% - Kun 4 brands (Apple, Sony, Bose, Patagonia) viste sig på tværs af alle tre platforme.
-
Kønsfortegn: 33-61% færre brands for "kone" forespørgsler - Statistisk analyse (p<0,001) bekræfter, at dette er systematisk, ikke tilfældigt.
-
Platform bias: Amazon i 95% af Groks mand-forespørgsler - Nogle platforme har klare favoritter, der dominerer anbefalinger.
Gender-Based Brand Mention Disparity
All three models show 33-61% lower brand mentions for "wife" vs "husband" gift queries. Statistical significance: p<0.001 (Chi-Square test).
Chi-Square test (χ²=137.32, p<0.001) confirms systematic gender-category bias. This is not random variation.
Kindle-fænomenet
Kindle viste sig i 100% af Geminis kone-gaveanbefalinger, men kun i 15% af mand-gaveanbefalinger. Samme produkt. Samme brand. Fuldstændig forskellig AI-behandling baseret på et enkelt ord i forespørgslen. Dette er ikke visibility. Dette er lotteri-niveau variation.
Amazon-effekten
Amazon viste sig i 95% af Groks mand-gaveanbefalinger (38 ud af 40 forespørgsler). For en platform, der hævder at give objektive anbefalinger, afslører denne koncentration, at "AI visibility" ofte betyder "platform-specifik bias", som du ikke kan kontrollere.
GPT-paradokset
Verdens mest populære AI-assistent nægter at nævne brands 70% af tiden. Ethvert brand, der sporer GPT-5.2 visibility, sporer en platform, der aktivt undgår den adfærd, du optimerer for.
Hvorfor dette betyder noget for din omsætning
Du kan ikke styre det, du ikke kan måle. Og i øjeblikket måler de fleste AI visibility-værktøjer helt det forkerte.
Rapporter om enkelt forespørgsel er statistisk meningsløse. Hvis Geminis anbefalinger ændres 52% mellem forespørgsler, fortæller et enkelt øjebliksbillede dig intet om din faktiske visibility. Du har brug for variansdata, ikke øjebliksbilleder.
Strategier på tværs af platforme er bygget på sand. Når platforme kun er enige om brands 14% af tiden, er enhver strategi, der hævder "omfattende AI visibility" enten løgnagtig eller forstår ikke dataene.
Dine konkurrenter er lige så blinde som du. Enhver konkurrentanalyse, der ikke måler konsistens, gætter. Det brand, der så ud til at "vinde" AI visibility sidste uge, kan bare have været heldig på tidspunktet for forespørgslen.
De brands, der vinder inden for AI, er ikke dem med de bedste resultater fra enkelt forespørgsel. De er dem, der forstår variation, måler stabilitet og tilpasser deres strategier platform for platform.
Hvad du burde gøre nu
1. Test på flere platforme
Stop med at behandle "AI visibility" som en enkelt metrik. Gemini, GPT, Grok og Perplexity har fundamentalt forskellige anbefalingsadfærd. Du har brug for platform-specifikke strategier og platform-specifik måling.
2. Test på tværs af promptvariationer
Vores forskning fandt nul brand-overlap mellem mand-, kone- og generiske 2025 gaveforespørgsler. En enkelt prompt repræsenterer ikke din faktiske visibility. Test variationer, herunder køns-framing, tidsmæssig framing og kategori-niveau kontra brand-niveau forespørgsler.
3. Mål stabilitet, ikke kun tilstedeværelse
Et brand, der vises 10 ud af 10 gange ved lav fremtræden, kan være mere værdifuldt end et, der vises 3 ud af 10 gange ved høj fremtræden. Konsistensscore fortæller dig, hvad AI faktisk mener, ikke hvad det tilfældigvis sagde én gang.
4. Overvåg kontinuerligt
Gemini ændrede sine anbefalinger 4 gange på 2 timer under vores forskning. Månedlige rapporter er arkæologi. Du har brug for løbende overvågning for at fange platform-niveau ændringer, før dine konkurrenter gør det.
De visualiseringer, der fortæller historien
Vores forskning producerede flere nøglevisualisering, der illustrerer AI-anbefalingsustabilitet:
1. Sammenligning af konsistensscore Et søjlediagram, der viser Grok på 77%, Gemini på 48% og GPT-5.2 effektivt på 0% (på grund af bevidst brand-undgåelse). Visuelt bevis for, at platforme opfører sig fundamentalt forskelligt.
2. Brand overlap Venn-diagram Tre cirkler, der repræsenterer Gemini (46 unikke brands), Grok (42 unikke brands) og GPT-5.2 (7 unikke brands), med kun 4 brands i centerens overlap. Illustrerer 14% enigheds-problemet.
3. Kønsfortegn-diagram Side-by-side sammenligning af brand-omtale-satser for mand-forespørgsler kontra kone-forespørgsler. Alle tre platforme viser 33-61% lavere brand-tæthed for kone-forespørgsler. Statistisk signifikans: p<0,001.
4. Temporal stabilitets-diagram Linjegraf, der viser Geminis fire på hinanden følgende kørsler: 14,0, 3,7, 13,1, 13,3 gennemsnitlige brands. Demonstrerer, hvor hurtigt anbefalinger kan skifte uden nogen eksterne ændringer.
5. Platform-specifikke vindere Vandrette søjlediagrammer, der viser Amazon på 95% omtale-rate for Groks mand-forespørgsler og Kindle på 100% omtale-rate for Geminis kone-forespørgsler. Afslører platform-specifikke bias, som enkelt-platform-analyse ville gå glip af.
Metodologi: Hvordan vi kørte denne undersøgelse
- Stikprøvestørrelse: 239 samlede forespørgsler (120 mand, 89 kone, 30 generisk 2025)
- Platforme testet: Gemini 3 Flash Preview, GPT-5.2, Grok-4-1-fast-reasoning
- Temperatur: 0,7 (standard for kreative opgaver)
- Statistisk validering: Chi-kvadrat test (p<0,001), Gini-koefficient analyse, Shannon entropi for distributionsligehed
- Brand korpus: 95 kendte forbrugerbands på tværs af 7 kategorier
- Post-hoc analyse: 8 yderligere analyser udført på eksisterende data uden API-omkostninger, herunder tværs-model Jaccard-indeks og brand co-forekomst-mapping
Denne forskning blev gennemført af Rankfor.AI research-holdet i december 2025.
Relateret forskning
Kønsfortegn i AI-anbefalinger: Kindle 100% kone, 0% mand
AI anbefaler 41-61% færre brands for "kone" forespørgsler sammenlignet med "mand" forespørgsler. Vores analyse af 299 forespørgsler afslører systematisk kønsfortegn, der udelukker hele produktkategorier baseret udelukkende på forespørgsels-framing. Hvis du ikke tester køns-variationer, måler du kun halvdelen af billedet.
Nøglefund: 33 brands er køns-eksklusive—vises kun i mand-indrammede eller kvinde-indrammede forespørgsler, aldrig begge. Statistisk signifikans: χ²=137,32, p<0,001.
Se hvad AI faktisk mener om dit brand
Du har to valg: fortsæt med at stole på øjebliksbillede-rapporter med enkelt forespørgsel, der fortæller dig intet om faktisk visibility, eller begynde at måle det, der betyder noget.
Rankfor.AI er den første platform bygget til at måle AI visibility på den rigtige måde. Vi sporer konsistens på tværs af platforme, overvåger variation over tid, og giver dig de data, du har brug for for faktisk at vinde anbefalinger i stedet for at håbe på, at du var heldig på en enkelt forespørgsel.
Få dit gratis AI Visibility snapshot. Én URL. Alle større platforme. Rigtig konsistensdata. Se hvad AI faktisk mener om dit brand, ikke hvad det tilfældigvis sagde én gang.
Få din gratis AI Visibility-score
Forskning gennemført af Rankfor.AI, december 2025. Fuldstændig metodologi og rå data er tilgængelige efter anmodning.
Nøgletermer (Marketer-venlige definitioner)
-
Konsistensscore: Hvor ofte AI giver samme svar, når spurgt samme spørgsmål. Grok på 77% betyder, at det giver nogenlunde samme brand-anbefalinger 77% af tiden.
-
Tværs-platform-enighed (Jaccard-indeks): Hvor meget overlap der eksisterer mellem det, som forskellige AI-platforme anbefaler. Ved 14% er platformene uenige om 86% af brand-anbefalinger.
-
Brand-tæthed: Gennemsnitligt antal brands nævnt pr. AI-svar. Gemini gennemsnitligt 10,27 brands; GPT-5.2 gennemsnitligt 0,63.
-
Temporal stabilitet: Hvor meget anbefalinger ændrer sig over tid uden nogen eksterne faktorer. Geminis 74% fald i brand-omtaler inden for 2 timer viser lav temporal stabilitet.
-
Platform bias: Når en specifik platform uforholdsmæssigt anbefaler bestemte brands. Amazon i 95% af Grok-svar er et eksempel på ekstrem platform bias.
People Also Ask
Continue Reading
Only 1 in 6 Brands Has Strong AI Visibility: Corporate Visibility Pattern Analysis
Analysis of 195 AI queries across 6 corporate brands reveals three visibility patterns: Invisible (PGE, Polpharma), Brand-Dependent (TotalEnergies, Holcim), Topic-Locked (Orlen). Only 1 in 6 has strong AI presence.
The "Best Of" Trap: Why Self-Promotional Listicles Are Losing Google and Winning ChatGPT
Three signals in one week: Google penalized self-promotional listicles (SaaS brands losing 34-49% visibility), reduced crawl limits by 86.7%, while Ahrefs found 44% of ChatGPT citations come from those exact listicles. Google is shrinking, AI is expanding. Includes a 5-minute brand audit playbook and split strategy for navigating both discovery systems.
Only 2 Brands Are Visible Across All AI Platforms. Is Yours One of Them?
We ran 480 queries across three AI platforms. Cross-model agreement on brand recommendations was only 10-45%. We identified 26 gender-locked brands, discovered that only LEGO and Disney achieve universal visibility, and found that AI recommends 41% fewer brands for wife queries than husband queries.
Four-Prompt Gender Bias Analysis: Isolating Gender Effects in LLM Brand Recommendations
This study extends cross-prompt LLM brand consistency analysis by introducing a gender-neutral "partner" prompt to isolate gender bias effects. Comparing four prompt variations across 299 total samples, we provide strong evidence of gender-based brand recommendation bias in LLMs. Critical finding: Kindle appeared in 100% of wife AND partner iterations but 0% of husband iterations.
BeVisible Club
Get research like this before we publish it.
New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.
Join BeVisible ClubWant to Know How AI Sees Your Brand?
Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.
About the Author

Research Team
The Rankfor.AI Research Team conducts original studies on AI visibility, LLM brand recommendations, and generative engine optimization. Our research is open-access, peer-reviewed internally, and designed to help marketers understand how AI shapes brand perception.
