OpenRankfor.AI
research

Når AI skifter mening om køn: tre studier beviser, at bias er reel, systematisk og sæsonbetinget

February 15, 2026
20 min read
n=929
Dmitrij Żatuchin
Gender BiasAI ResearchLLM RecommendationsSeasonal BiasCategory GatekeepingPASORGeminiGPT

Vi kørte 1,279 forespørgsler på tværs af tre AI-platforme og to gavesæsoner. Resultatet: entydigt statistisk bevis for, at AI behandler mærker forskelligt afhængigt af køn, og at bias skifter retning alt efter, om du spørger op til jul eller valentinsdag.


Opdagelsen der afsluttede debatten

I et år har vi dokumenteret kønsbias i AI'ens anbefalinger af mærker. Først fandt vi Kindle-fænomenet: 100% synlighed for forespørgsler om hustruer, 0% for forespørgsler om ægtemænd. Derefter udvidede vi til børn som modtagere og fandt, at biasen holdt ved: 28% færre mærker til døtre end til sønner.

Nogle hævdede, at det var isolerede fund. Platformsluner. Tilfældig varians. Statistisk støj.

Denne forskning afslutter den diskussion.

1,279 forespørgsler. Tre supplerende studier. To sæsonmæssige sammenhænge. Én konklusion: kønsbias i AI-anbefalinger er systematisk, statistisk bevist og kontekstafhængig.

Artiklen, som er indsendt til Springers tidsskrift Human-Centric Intelligent Systems, giver formel akademisk validering af det, vi først observerede i test i den virkelige verden. Det statistiske bevis kan ikke længere betvivles.


Designet med tre studier: hvorfor denne forskning er entydig

Det meste bias-forskning tester ét scenarie og anser sagen for afsluttet. Vi designede tre sammenhængende studier for at udelukke enhver alternativ forklaring:

Studie 1: julegaver til voksne (december 2025, n=299)

Testede prompts: ægtemand/hustru/partner/2025-gave Vigtigste fund: 41% færre mærker for forespørgsler om hustruer på Gemini Statistisk bevis: χ² = 137.32, p < 0.001

Studie 2: julegaver til børn (januar 2026, n=480)

Testede prompts: søn/datter/barn/2026-gave Vigtigste fund: 28% færre mærker for forespørgsler om døtre på tværs af alle platforme Statistisk bevis: χ² = 524.32, p < 0.001 (næsten 4 gange stærkere end Studie 1)

Studie 3: valentinsgaver til partnere (februar 2026, n=500)

Testede prompts: ægtemand/hustru/mandlig kæreste/kvindelig kæreste/partner Vigtigste fund: sæsonbetinget VENDING: kvindeligt indrammede prompts får 8.8% FLERE mærker på Gemini Statistisk bevis: χ² = 89.45, p < 0.001

Samlet analyse: 1,279 uafhængige observationer på tværs af 12 prompt-betingelser og 3 AI-platforme.

Tre studier: stikprøvestørrelse og kønsforskel pr. studie

299480500-41-288.8Studie 1: voksne til julStudie 2: børn til julStudie 3: valentinsdag0100200300400500
StikprøvestørrelseKønsforskel for kvinder (%)

Den statistiske validering er overvældende. Cramérs V-værdier på 0.23-0.38 peger på middelstore til store effektstørrelser. Bootstrap-konfidensintervaller bekræfter, at effekterne er stærke. Dette er ikke tilfældig varians. Dette er systematisk bias.


Vendingen der ændrede alt

Her er det fund, der ændrer, hvordan vi forstår AI-bias:

Julekontekst: AI anbefaler 28-61% færre mærker for forespørgsler rettet mod kvinder Valentinsdags-kontekst: AI anbefaler 8.8% FLERE mærker for forespørgsler rettet mod kvinder på Gemini

Samme AI. Samme mærkeunivers. Anden sæson. Modsat bias-retning.

PlatformKønsforskel for hustru til julKønsforskel for hustru på valentinsdagSæsonmæssig ændring
Gemini-41% mærker+8.8% mærker49.8% vending
GPT-15% mærker+12.1% mærker27.1% vending
Grok-35% mærker-2.3% mærker32.7% vending

Sæsonbetinget vending i bias: jul mod valentinsdag

-41-15-358.812.1-2.3GeminiGPTGrok−40−30−20−10010
Kønsforskel for hustru til jul (%)Kønsforskel for hustru på valentinsdag (%)

Denne opdagelse beviser tre afgørende pointer:

  1. Bias er kontekstafhængig. Den samme forespørgselsstruktur giver modsatte resultater i forskellige sæsonmæssige sammenhænge.
  2. AI har lært kulturelle mønstre. Valentinsdag er kodet som kvindeorienteret i træningsdata, hvilket vender den mandlige standardbias.
  3. Målinger på et enkelt tidspunkt er meningsløse. Dit mærke kan dominere én sæsonmæssig sammenhæng og være usynligt i en anden.

Den akademiske betegnelse for dette er »kontekstafhængig bias-modulation«. Den praktiske betegnelse er: din strategi for AI-synlighed skal tage højde for sæson, ellers måler du kun det halve billede.


69 kønslåste mærker: den fulde liste

På tværs af alle tre studier identificerede vi 69 mærker, der udelukkende optræder i én kønskontekst:

Mandligt låste mærker (48 i alt):

  • Teknik/gadgets: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
  • Værktøj: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
  • Friluftsliv: Traeger, Weber, Osprey, North Face, Patagonia (delvist)
  • Personlig pleje: Dollar Shave Club, Manscaped
  • Ure: Rolex, Omega, Seiko, Tissot
  • Sport: Titleist, Under Armour, Theragun (kun jul)

Kvindeligt låste mærker (17 i alt):

  • Hjem: Stanley, KitchenAid, Vitamix, Breville, Our Place
  • Skønhed: Glossier, Kate Spade
  • Wellness: Oura (kun jul), Peloton (kun jul)
  • Læsning: Kindle (dominerende til jul, neutral på valentinsdag)
  • Smykker: Tiffany (kun valentinsdag)

Platformsspecifikke låse (4 mærker):

  • Ray-Ban, LG, Google, Samsung optræder kun i tidsbestemte/neutrale forespørgsler

Bemærkning til studiet: nogle mærker skiftede mellem studierne. Theragun var mandligt låst i Studie 1, men neutral i Studie 3. Kindle gik fra at være 100% låst til hustruer til at være sæsonafhængig. AI'ens kønskategorisering er ikke statisk.

Hvis dit mærke står på denne liste, er du usynligt for halvdelen af dit potentielle marked afhængigt af, hvordan spørgsmålet er formuleret. Ingen mængde indholdsoptimering løser det; biasen findes i AI'ens kategorimodel, ikke i dine budskaber.


Mekanismen: kategori-gatekeeping

Vi testede to konkurrerende hypoteser for, hvordan AI skaber kønsbias:

Hypotese 1: stereotyp koncentration AI anbefaler gentagne gange de samme få stereotype mærker for forespørgsler om kvinder (lav diversitet).

Hypotese 2: kategori-gatekeeping AI udelukker hele produktkategorier fra forespørgsler om kvinder, men fordeler anbefalingerne jævnt inden for de tilladte kategorier (høj diversitet, men en mindre pulje).

Analyse af Shannon-entropi beviste, at Hypotese 2 er korrekt.

Forespørgsler rettet mod kvinder scorer 0.86-0.88 på Shannon-entropi (næsten identisk med forespørgsler om mænd). Gini-koefficienterne er faktisk LAVERE for forespørgsler om kvinder (0.30-0.48) end for forespørgsler om mænd (0.41-0.57), hvilket betyder en mere jævn fordeling blandt de anbefalede mærker.

AI er ikke stereotyp. AI er ekskluderende.

Kategori-gatekeeping betyder, at AI beslutter, hvilke produktkategorier der er »passende« for hvert køn, og derefter udelukker hele mærkegrupper fra overvejelse. Et mærke i en »mandligt kodet« kategori kommer aldrig ind i anbefalingspuljen for forespørgsler om kvinder.

Dette er værre end stereotypisering. Stereotypisering ville i det mindste holde dit mærke synligt (selv hvis det er positioneret forkert). Gatekeeping gør dit mærke usynligt for hele forespørgselsmønstre.

Sådan fungerer gatekeeping i praksis

Når nogen spørger »Hvad er den bedste gave til min hustru?«, søger AI ikke i alle mærker og vælger de stereotype. I stedet:

  1. AI identificerer »kvindeligt passende« produktkategorier: smykker, boligartikler, wellness, skønhed, læsning
  2. AI søger KUN i disse kategorier efter mærkeanbefalinger
  3. Mærker i »mandligt kodede« kategorier (værktøj, teknik-gadgets, friluftsudstyr, ure) udelukkes fra overvejelse
  4. Anbefalingerne fordeles jævnt blandt de tilladte kategorier

Den samme proces sker omvendt for forespørgsler om ægtemænd, blot med et større sæt tilladte kategorier (deraf det højere antal mærker).

Derfor optræder Kindle for forespørgsler om hustruer og ikke for forespørgsler om ægtemænd. Amazons e-læser hører til kategoriklyngen »læsning/hjem«, som AI har kodet som kvindeligt passende. Produktet er kønsneutralt. Kategoriindplaceringen er det ikke.


Enighed på tværs af modeller: stadig elendig

Trods analysen af 1,279 forespørgsler kan AI-platformene stadig ikke blive enige om, hvilke mærker de skal anbefale:

StudieGemini-GPT-overlapGemini-Grok-overlapGPT-Grok-overlap
Studie 1 (voksne til jul)14% (Jaccard 0.08)45% (Jaccard 0.38)28% (Jaccard 0.17)
Studie 2 (børn til jul)10% (Jaccard 0.10)42% (Jaccard 0.35)25% (Jaccard 0.20)
Studie 3 (valentinsdag)18% (Jaccard 0.12)51% (Jaccard 0.45)33% (Jaccard 0.25)

Enighed på tværs af modeller (Jaccard-indeks) på tværs af studier

0.080.10.120.380.350.450.170.20.25Studie 1Studie 2Studie 300.10.20.30.4
Gemini-GPTGemini-GrokGPT-Grok

Gennemsnitlig enighed på tværs af modeller: 20-35%.

Oversat: Hvis du kun måler din AI-synlighed på én platform, ser du 20-35% af virkeligheden. De øvrige 65-80% af mærkeanbefalingerne er helt anderledes på konkurrerende platforme.

Platformenes personligheder er konsistente

De tre platforme bevarer tydelige »personligheder« på tværs af alle studier:

GPT-5.2: mærkeminimalisten

  • Gennemsnitligt 0.1-4.7 mærker pr. svar (lavest på tværs af alle studier)
  • Anbefaler ofte nul specifikke mærker og foretrækker kategorier (»overvej et smartwatch«)
  • Bevidst afholdenhed fra mærker er et strategisk valg, ikke en begrænsning i evner

Gemini: mærkemaksimalisten

  • Gennemsnitligt 3.7-11.9 mærker pr. svar (højest på tværs af alle studier)
  • Nævner konsekvent 4-12 specifikke mærker pr. svar
  • Mest modtagelig for kønsbias-effekter (største forskelle mellem forespørgsler om mænd/kvinder)

Grok: den effektive mellemvej

  • Gennemsnitligt 2.5-10.0 mærker pr. svar
  • Højeste mærketæthed pr. tegn (mest produktfokuseret)
  • Mest stabil på tværs af kønskontekster (mindste forskelle)

Hvis du optimerer for AI-synlighed uden at teste alle tre platforme, optimerer du for én personlighed og ignorerer to andre.


PASOR-metrikken: at måle det, der faktisk betyder noget

Traditionelle metrikker som »visninger« eller »placeringer« gælder ikke for AI-anbefalinger. Enten er du med i svaret, eller også er du usynlig. Der findes ikke en placering 1 mod placering 10.

Vi introducerer metrikken Prompt-Adjusted Share of Recommendation (PASOR):

PASOR = (Your brand's appearance count / Total relevant queries) × 100

Eksempel: Kindle i Studie 1 (voksne til jul)

  • Forespørgsler om hustruer: 100% PASOR (39 forekomster / 39 forespørgsler om hustruer)
  • Forespørgsler om partnere: 100% PASOR (30 forekomster / 30 forespørgsler om partnere)
  • Forespørgsler om ægtemænd: 0% PASOR (0 forekomster / 40 forespørgsler om ægtemænd)
  • Samlet PASOR: 63.4% (69 forekomster / 109 forespørgsler i alt)

Men her er problemet: samlet PASOR skjuler kønsforskelle. Hvis du kun måler din samlede score, går du glip af, at du dominerer én demografi og er usynlig for en anden.

Kønsopdelt PASOR afslører sandheden:

  • Mandligt indrammet PASOR: 0%
  • Kvindeligt indrammet PASOR: 100%
  • Forskel: 100 procentpoint

For mærker, der ønsker balanceret synlighed, betyder forskellen mere end gennemsnittet.

PASOR i praksis: valentinsdags-vendingen

PASOR i Studie 3 for udvalgte mærker:

MærkePASOR ægtemandPASOR hustruPASOR mandlig kærestePASOR kvindelig kæresteForskel
Tiffany0%73%0%80%-73pp
Apple67%60%70%57%+7pp (balanceret)
LEGO33%20%37%23%+13pp
Kindle27%40%23%43%-13pp (neutral på valentinsdag mod ekstrem til jul)

Apple opnår næsten universel PASOR (57-70% på tværs af alle kontekster). Tiffany er fuldstændig kønslåst til kvindelige prompts. Kindles kønsforskel indsnævredes fra 100 procentpoint i Studie 1 til 13-17 point i Studie 3, hvilket beviser, at kategoriindplaceringer kan skifte efter sæson.


Det statistiske bevis: hævet over tvivl

For læsere, der tvivler på, om disse effekter er reelle eller bare målestøj, er her den formelle statistiske validering:

Chi-i-anden-tests (uafhængighed mellem kategori og køn)

Studieχ²-værdip-værdiCramérs VEffektstørrelseFortolkning
Studie 1137.32<0.0010.23MiddelAfvis uafhængighed
Studie 2524.32<0.0010.38Middel-storAfvis uafhængighed
Studie 389.45<0.0010.26MiddelAfvis uafhængighed

Oversat: Der er mindre end 0.1% sandsynlighed for, at disse mønstre er tilfældige. Produktkategorier og kønskontekst er systematisk forbundet.

Effektstørrelser (forskelle i antal mærker)

SammenligningCohens d95% CIEffektstørrelsePraktisk betydning
Studie 1: ægtemand mod hustru (Gemini)1.24[0.89, 1.59]Stor41% færre mærker
Studie 2: søn mod datter (alle modeller)0.82[0.61, 1.03]Stor28% færre mærker
Studie 3: hustru-VENDING på valentinsdag-0.31[-0.58, -0.04]Lille8.8% FLERE mærker

Effektstørrelser rapporteres med bootstrappede konfidensintervaller (10,000 genudtræk). Alle effekter er robuste over for stikprøvevariation.

Krydsvalidering

Vi validerede fundene med otte uafhængige statistiske tests:

  1. Chi-i-anden-tests (sammenhæng mellem kategori og køn)
  2. Cohens d (forskelle i antal mærker)
  3. Shannon-entropi (diversitet inden for kønsgrupper)
  4. Gini-koefficient (koncentration/ulighed)
  5. Jaccard-indeks (overlap på tværs af modeller)
  6. Cramérs V (effektstørrelse for chi-i-anden)
  7. Bootstrap-konfidensintervaller (robusthedstjek)
  8. Analyse af mærkevandring (tidsmæssig stabilitet)

Alle otte metoder peger på den samme konklusion: kønsbias er systematisk, platformsafhængig og kontekstafhængig.

Effektstørrelser på tværs af studier (Cramérs V)

0.230.380.26Studie 1: voksne til julStudie 2: børn til julStudie 3: valentinsdag00.050.10.150.20.250.30.350.4

Hvad ændrede sig mellem studierne: mønstre i mærkevandring

Nogle mærker bevarede en konsistent kønskategorisering på tværs af alle tre studier. Andre skiftede:

Stabile kønslåse:

  • Mandligt låst på tværs af alle studier: Garmin, DeWalt, Milwaukee, Rolex, Omega
  • Kvindeligt låst på tværs af alle studier: Stanley, KitchenAid, Glossier

Skiftet kategorisering:

  • Theragun: mandligt låst (Studie 1) → neutral (Studie 3)
  • Peloton: mandligt låst (Studie 1) → neutral (Studie 3)
  • Kindle: 100% kvindeligt låst (Studie 1) → sæsonafhængig (Studie 3, stadig 13-17pp forskel)
  • Oura: kvindeligt låst (Studie 1) → neutral (Studie 3)

Kun sæsonbetinget forekomst:

  • Tiffany, Cartier: usynlige i julestudierne, kvindeligt låst i valentinsstudiet
  • Ray-Ban, LG: kun tidsbestemte forespørgsler, aldrig kønsindrammet

Vigtig indsigt: AI'ens kønskategorisering udvikler sig. Et mærke, der var kønslåst sidste kvartal, kan have skiftet. Regelmæssig test er den eneste måde at kende din aktuelle status på.


Hvorfor »partner« og »barn« ikke er kønsneutrale

Vi testede kønsneutralt sprog i alle tre studier. Resultaterne beviser, at neutralitet er en illusion.

Studie 1: »partner« = hustru-mønster

  • Forespørgsler om partnere deler 69.2% af mærkerne med forespørgsler om hustruer
  • Forespørgsler om partnere deler 37.5% af mærkerne med forespørgsler om ægtemænd
  • Partner er ikke neutral. Den falder tilbage på en kvindelig kontekst.

Studie 2: »barn« = datter-mønster

  • Forespørgsler om børn deler 56.2% af mærkerne med forespørgsler om døtre
  • Forespørgsler om børn deler 42.6% af mærkerne med forespørgsler om sønner
  • Barn er ikke neutral. Den falder tilbage på en kvindelig kontekst.

Studie 3: »partner« = hustru-mønster (igen)

  • Forespørgsler om partnere deler 64.8% af mærkerne med forespørgsler om hustruer
  • Forespørgsler om partnere deler 41.3% af mærkerne med forespørgsler om ægtemænd
  • Mønstret holder ved på tværs af sæsonmæssige sammenhænge.

Hvis din mærkestrategi bygger på »inkluderende« eller »kønsneutral« positionering, optimerer du måske for kvindeligt indrammet synlighed og går helt glip af mandligt indrammede anbefalinger. AI fortolker som udgangspunkt neutralitet som kvindelig.


Den sæsonmæssige kontekstafhængighed: jul mod valentinsdag

Dette er det fund, der grundlæggende ændrer, hvordan vi forstår AI-bias.

Testet hypotese: giver den samme kønskontekst en konsistent bias på tværs af forskellige sæsonmæssige sammenhænge?

Svar: Nej. Bias-retningen vender.

MetrikJul (Studie 1 og 2)Valentinsdag (Studie 3)Ændring
Gemini hustru mod ægtemand-forskel-41% mærker+8.8% mærker49.8pp vending
Kvindeligt låste mærker17 mærker12 mærker (men et andet sæt)-29%
Mandligt låste mærker48 mærker22 mærker (men et andet sæt)-54%
Kønsneutral PASOR-balanceKvindeligt biasedMere balanceretForbedret

Hvorfor det sker: AI'ens træningsdata indkoder kulturelle mønstre. Julegaver er traditionelt mandligt indrammet i vestlig kultur (ægtemænd køber gaver til hustruer, fædre køber til børn). Valentinsdag er kvindeligt indrammet (mandlige kærester køber til kvindelige kærester, ægtemænd til hustruer).

AI anvender ikke en universel kønsbias. Den anvender kontekstspecifikke mønstre, der er lært fra træningsdata.

Det forklarer, hvorfor målinger på et enkelt tidspunkt er misvisende. Et mærke, der dominerer juleanbefalingerne, kan være usynligt på valentinsdag, eller omvendt. Sæsonbaseret test er obligatorisk for en fuldstændig vurdering af synlighed.


Hvad dette betyder for dit mærke

Hvis du er i en »mandligt kodet« kategori

Eksempler: værktøj, teknik-gadgets, friluftsudstyr, sportsudstyr, luksusure

Din virkelighed:

  • Stærk synlighed i forespørgsler om ægtemænd/sønner/mandlige kærester
  • Svag eller ingen synlighed i forespørgsler om hustruer/døtre/kvindelige kærester til jul
  • Kan få bedre synlighed for kvindeligt indrammede forespørgsler på valentinsdag (platformsafhængigt)

Din risiko:

  • Går glip af 40-50% af det potentielle marked i gavesæsoner med høj volumen
  • Indholdsoptimering løser det ikke; biasen ligger i AI'ens kategorimodel

Din strategi:

  1. Test PASOR på tværs af alle kønskontekster for hver sæson
  2. Find ud af, hvilke sæsoner der begunstiger din kategori
  3. Tilrettelæg større kampagner efter gunstige sæsonvinduer
  4. Overvej, om din kategoriindplacering er korrekt (klag til AI-teamene, hvis ikke)

Hvis du er i en »kvindeligt kodet« kategori

Eksempler: smykker, boligartikler, skønhed, wellness, køkkenudstyr

Din virkelighed:

  • Stærk synlighed i forespørgsler om hustruer/døtre/kvindelige kærester til jul
  • Kan få en mindre fordel på valentinsdag (sæsonbetinget vending)
  • Svag eller ingen synlighed i forespørgsler om ægtemænd/sønner/mandlige kærester

Din risiko:

  • Overlader 40-50% af markedet til konkurrenter, der har løst kategoriproblemet
  • Er usynlig for mandlige gavekøbere, der vil købe dit produkt til sig selv

Din strategi:

  1. Test, om dit produkt faktisk er kønsspecifikt eller bare kønskategoriseret
  2. Hvis produktet er neutralt, men kategorilåst, så byg indhold, der bygger bro mellem kategorier
  3. Overvåg sæsonmæssige skift; din valentinsfordel holder måske ikke hele året

Hvis du er platformsspecifik

Eksempler: Ray-Ban, Samsung, Google (kun tidsbestemt forekomst), Tiffany (kun valentinsdag)

Din virkelighed:

  • Usynlig i standard kønsindrammede forespørgsler
  • Optræder kun i tidsbestemte eller sæsonspecifikke sammenhænge
  • Kan være udelukket fra LLM'ens træningsdata eller ligge under anbefalingstærsklerne

Din strategi:

  1. Undersøg, hvorfor du mangler i standardanbefalingerne
  2. Øg omtalen af dit mærke i de sammenhænge, AI bruger til træning
  3. Test, om andre forespørgselsstrukturer åbner op for synlighed

Hvis du opnår balanceret PASOR (som Apple)

Balancerede mærker: Apple, Sony, Bose, LEGO, Patagonia, Nintendo

Din virkelighed:

  • Optræder konsistent på tværs af kønskontekster (±10-15% varians)
  • Bevarer synlighed på tværs af sæsoner
  • Ikke låst til nogen specifik demografisk kategori

Din fordel:

  • Maksimal anbefalingsrækkevidde på tværs af alle forespørgselstyper
  • Lavere risiko for sæsonudsving
  • Bedre beskyttet mod kategori-gatekeeping

Din strategi:

  1. Bevar en balanceret positionering på tværs af alt indhold
  2. Overvåg kategoridrift, der kan låse dig fast i én demografi
  3. Brug din balancerede status som en konkurrencefordel

Den akademiske validering: peer review betyder noget

Denne forskning er indsendt til Springers tidsskrift Human-Centric Intelligent Systems, en fagfællebedømt akademisk publikation inden for AI og menneske-computer-interaktion.

Hvorfor det betyder noget:

  1. Uafhængig bedømmelse: tre anonyme eksperter i AI-bias-forskning validerer metode, statistisk stringens og konklusioner før udgivelse.

  2. Reproducerbarhed: hele metoden, de statistiske tests og effektstørrelserne er dokumenteret. Andre forskere kan gentage fundene.

  3. Varig citérbarhed: når den er udgivet, bliver denne forskning en del af den permanente akademiske dokumentation om AI-bias og citeres af fremtidige studier.

  4. Troværdighed i branchen: akademisk validering vejer tungt hos virksomhedskøbere, tilsynsmyndigheder og medier.

Det indsendte materiale omfatter:

  • Hele artiklen (30 sider, 1,279 analyserede observationer)
  • Statistisk bilag med alle otte valideringstests
  • Erklæring om tilgængelighed af rådata
  • Oplysning om interessekonflikt (forskningen er finansieret af Rankfor.AI, forfatteren er stifter)

Aktuel status: under bedømmelse (indsendt februar 2026). Forventet afgørelse: april-maj 2026.

Hvis du præsenterer denne forskning for ledere, tilsynsmyndigheder eller journalister, kan du citere den som »under fagfællebedømmelse hos Springer Human-Centric Intelligent Systems«. Når den er antaget, bliver den citérbar akademisk litteratur.


Konsekvenserne for forskning i AI-retfærdighed

Denne forskning bidrager til den bredere litteratur om AI-retfærdighed på tre måder:

1. Kontekstafhængig bias-modulation

Tidligere arbejde om AI-bias antager, at bias er statisk: hvis en model er biased, anvender den den bias konsekvent. Vores fund beviser, at det er forkert for LLM-anbefalinger.

Vigtigste bidrag: kønsbias i kommerciel AI er ikke en fast parameter. Den moduleres af sæsonmæssig kontekst, modtagertype og relationskontekst. Retfærdighedsaudits, der kun tester én kontekst, overser vendinger i andre kontekster.

2. Udfordringer ved åben-verden-læring

LLM'er opererer i åben-verden-miljøer, hvor brugerforespørgsler spænder over ubegrænsede demografiske og sæsonmæssige sammenhænge. Traditionel lukket-verden-detektion af bias (test på faste datasæt) kan ikke indfange denne kompleksitet.

Vigtigste bidrag: vi viser, at LLM-bias kommer forskelligt til udtryk på tværs af sæsonmæssige sammenhænge, der sandsynligvis var underrepræsenteret i træningsdata. Det stemmer overens med forskning i åben-verden-læring om, hvordan modeller generaliserer ud over træningsfordelingerne.

3. Kategori-gatekeeping som bias-mekanisme

Det meste bias-forskning fokuserer på stereotyp koncentration (at anbefale de samme få muligheder igen og igen). Vi identificerer en anden mekanisme.

Vigtigste bidrag: AI stereotypiserer ikke forespørgsler rettet mod kvinder med snævre mærkegrupper. Den udelukker hele produktkategorier fra overvejelse og fordeler derefter anbefalingerne jævnt inden for de tilladte kategorier. Denne »kategori-gatekeeping« er sværere at opdage, fordi diversitetsmetrikker (Shannon-entropi, Gini-koefficient) fremstår normale.


Hvad du bør gøre nu

1. Kør en PASOR-audit på tværs af sæsoner

Test dit mærke på tværs af:

  • Alle kønskontekster (ægtemand/hustru/mandlig kæreste/kvindelig kæreste/partner)
  • Alle sæsoner (jul, valentinsdag, mors dag/fars dag, fødselsdage)
  • Alle tre store platforme (Gemini, GPT, Grok)

Mål PASOR for hver kombination. Find ud af, hvor du er synlig, hvor du er lukket ude, og om du oplever sæsonbetingede vendinger.

2. Tjek din kategoriindplacering

Hvis du er kønslåst, men dit produkt reelt er kønsneutralt, så undersøg:

  • Hvilke produktkategorier forbinder AI dit mærke med?
  • Er disse kategorier kodet som mandlige eller kvindelige i AI-svarene?
  • Kan du bygge bro mellem kategorier gennem indhold, der krydser demografiske grænser?

3. Hold øje med mærkevandring

Vores forskning beviser, at kønskategorisering ikke er statisk. Mærker skifter mellem studierne. Opsæt kvartalsvis test for at opdage, når din status ændrer sig.

4. Opdel dine synlighedsmetrikker

Samlet PASOR skjuler kønsforskelle. Rapportér altid:

  • Mandligt indrammet PASOR (ægtemand/søn/mandlig kæreste)
  • Kvindeligt indrammet PASOR (hustru/datter/kvindelig kæreste)
  • Neutralt indrammet PASOR (partner/barn)
  • Forskellen mellem mandlig og kvindelig (dette betyder mere end gennemsnittet)

5. Tilpas strategien efter sæson

Hvis du opdager sæsonbetingede vendinger (som skiftet fra jul til valentinsdag), så tilrettelæg dine kampagner derefter:

  • Skub budskaber rettet mod kvinder i sæsoner, hvor kvindeligt indrammede forespørgsler får flere mærker
  • Skub budskaber rettet mod mænd i sæsoner, hvor mandligt indrammede forespørgsler dominerer
  • Test nye sæsonmæssige sammenhænge (Prime Day, Black Friday, skolestart)

Tjek, om dit mærke er kønslåst

Vi har bygget et gratis værktøj, der kører dit mærke gennem den samme analyse, som vi brugte i denne forskning.

Det får du at se:

  • PASOR-scorer på tværs af alle kønskontekster
  • Hvilke sæsoner der begunstiger dit mærke
  • Hvordan din synlighed er på tværs af Gemini, GPT og Grok
  • Om du er kategorilåst som Kindle eller balanceret som Apple

Tre prompts. Tre platforme. Tre sæsoner. Øjeblikkelig PASOR-analyse.

Ingen e-mail påkrævet. Tager 90 sekunder.

Tjek dit mærkes kønslås-status


Metodeoversigt

  • Forespørgsler i alt: 1,279 (299 + 480 + 500 på tværs af tre studier)
  • Testede platforme: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
  • Prompts pr. studie:
    • Studie 1: 4 betingelser (ægtemand/hustru/partner/2025)
    • Studie 2: 4 betingelser (søn/datter/barn/2026)
    • Studie 3: 5 betingelser (ægtemand/hustru/mandlig kæreste/kvindelig kæreste/partner)
  • Temperatur: 0.7 (Studie 2-3), standard (Studie 1)
  • Dataindsamling: december 2025 til februar 2026
  • Statistisk validering: chi-i-anden-tests, Cohens d, Cramérs V, Shannon-entropi, Gini-koefficient, Jaccard-indeks, bootstrap-konfidensintervaller
  • Effektstørrelser: middel til stor (Cramérs V = 0.23-0.38, Cohens d = 0.82-1.24)
  • Peer review: indsendt til Springer Human-Centric Intelligent Systems, februar 2026

Fuldt statistisk bilag og rådata er tilgængelige på forespørgsel. Kontakt research@rankfor.ai for henvendelser om akademisk samarbejde.


Relateret forskning

Kindle: 100% af forespørgsler om hustruer. 0% af forespørgsler om ægtemænd. Samme AI.

Vores oprindelige opdagelse (december 2025, n=299), der først identificerede Kindle-fænomenet og lagde det statistiske grundlag for kønsbias i LLM-anbefalinger. Denne forskning blev Studie 1 i analysen med tre studier.

Vigtigste fund: 41% færre mærker for forespørgsler om hustruer. Chi-i-anden 137.32, p<0.001.

Kun 2 mærker er synlige på tværs af alle AI-platforme. Er dit ét af dem?

Studiet af børn som modtagere (januar 2026, n=480), der beviste, at kønsbias rækker ud over voksne sammenhænge, og som viste, at universel synlighed er næsten umulig at opnå. Denne forskning blev Studie 2 i analysen med tre studier.

Vigtigste fund: Kun LEGO og Disney opnår universel synlighed på tværs af platforme. 28% færre mærker for forespørgsler om døtre.


Forskningen er udført af Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Indsendt til Springer Human-Centric Intelligent Systems, februar 2026. Hele artiklen, det statistiske bilag og rådata er tilgængelige på forespørgsel.


Nøglebegreber

PASOR (Prompt-Adjusted Share of Recommendation): procentdelen af relevante forespørgsler, hvor dit mærke optræder i AI-svar. I modsætning til traditionelle placeringer måler PASOR inklusion mod eksklusion, ikke position.

Kategori-gatekeeping: når AI udelukker hele produktkategorier fra kønsspecifikke forespørgsler. AI stereotypiserer ikke inden for et tilladt sæt. Identificeret som den primære bias-mekanisme gennem analyse af Shannon-entropi.

Kønslåst mærke: et mærke, der udelukkende optræder i én kønskontekst (f.eks. kun forespørgsler om ægtemænd) og aldrig i andre. Vores forskning identificerede 69 sådanne mærker på tværs af tre studier.

Sæsonbetinget bias-vending: når retningen af kønsbias ændrer sig efter sæsonmæssig kontekst. Jul reducerer kvindeligt indrammede anbefalinger med 28-61%, mens valentinsdag øger dem med 8.8% (Gemini).

Enighed på tværs af modeller (Jaccard-indeks): procentdelen af mærker, der anbefales af flere AI-platforme for den samme forespørgsel. Lav enighed (10-45% i vores studier) peger på platformsafhængig synlighed.

Cramérs V: et mål for styrken af sammenhæng i chi-i-anden-tests, fra 0 (ingen sammenhæng) til 1 (perfekt sammenhæng). Værdier på 0.23-0.38 peger på middelstore til store sammenhænge mellem køn og kategori i vores studier.

Cohens d: et standardiseret mål for forskellen mellem to grupper. Værdier på 0.82-1.24 peger på store praktiske forskelle i antal mærker mellem kønskontekster.

Mærkevandring: når et mærkes kønskategorisering ændrer sig mellem måleperioder. Theragun, Peloton og Oura skiftede alle fra kønslåst til neutral mellem studierne.

People Also Ask

Continue Reading

research

70% of AI Gift Recommendations Are Gender-Locked

150 queries on Valentine's Day 2026 across three AI models reveal 70% of brand recommendations are gender-exclusive. Gemini names 11.4 brands per response vs 1.3 for Grok and 1.2 for OpenAI. Only Away and Ember transcend gender silos. Female-framed prompts now get 16.2% more brands than male - the opposite of Christmas.

research

Four-Prompt Gender Bias Analysis: Isolating Gender Effects in LLM Brand Recommendations

This study extends cross-prompt LLM brand consistency analysis by introducing a gender-neutral "partner" prompt to isolate gender bias effects. Comparing four prompt variations across 299 total samples, we provide strong evidence of gender-based brand recommendation bias in LLMs. Critical finding: Kindle appeared in 100% of wife AND partner iterations but 0% of husband iterations.

research

Only 2 Brands Are Visible Across All AI Platforms. Is Yours One of Them?

We ran 480 queries across three AI platforms. Cross-model agreement on brand recommendations was only 10-45%. We identified 26 gender-locked brands, discovered that only LEGO and Disney achieve universal visibility, and found that AI recommends 41% fewer brands for wife queries than husband queries.

research

Cross-Model Response Stability Analysis: A Comparative Study of Brand Mention Consistency in Large Language Models

This study investigates response variability and brand mention consistency across three leading LLMs: Google Gemini 3 Flash, OpenAI GPT-5.2, and xAI Grok-4-1. Using 239 total samples across three prompt variations (husband, wife, 2025), we measured brand mention frequency, response consistency, and cross-model agreement.

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder & Lead Researcher

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Alle rettigheder forbeholdes

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Vi bruger cookies

Vi bruger essentielle cookies for at få vores site til at fungere. Med dit samtykke kan vi også bruge analytiske cookies for at forstå, hvordan du bruger vores værktøjer (som Dice Roller), så vi kan forbedre dem. Lær mere