Vi kørte 1,279 forespørgsler på tværs af tre AI-platforme og to gavesæsoner. Resultatet: entydigt statistisk bevis for, at AI behandler mærker forskelligt afhængigt af køn, og at bias skifter retning alt efter, om du spørger op til jul eller valentinsdag.
Opdagelsen der afsluttede debatten
I et år har vi dokumenteret kønsbias i AI'ens anbefalinger af mærker. Først fandt vi Kindle-fænomenet: 100% synlighed for forespørgsler om hustruer, 0% for forespørgsler om ægtemænd. Derefter udvidede vi til børn som modtagere og fandt, at biasen holdt ved: 28% færre mærker til døtre end til sønner.
Nogle hævdede, at det var isolerede fund. Platformsluner. Tilfældig varians. Statistisk støj.
Denne forskning afslutter den diskussion.
1,279 forespørgsler. Tre supplerende studier. To sæsonmæssige sammenhænge. Én konklusion: kønsbias i AI-anbefalinger er systematisk, statistisk bevist og kontekstafhængig.
Artiklen, som er indsendt til Springers tidsskrift Human-Centric Intelligent Systems, giver formel akademisk validering af det, vi først observerede i test i den virkelige verden. Det statistiske bevis kan ikke længere betvivles.
Designet med tre studier: hvorfor denne forskning er entydig
Det meste bias-forskning tester ét scenarie og anser sagen for afsluttet. Vi designede tre sammenhængende studier for at udelukke enhver alternativ forklaring:
Studie 1: julegaver til voksne (december 2025, n=299)
Testede prompts: ægtemand/hustru/partner/2025-gave Vigtigste fund: 41% færre mærker for forespørgsler om hustruer på Gemini Statistisk bevis: χ² = 137.32, p < 0.001
Studie 2: julegaver til børn (januar 2026, n=480)
Testede prompts: søn/datter/barn/2026-gave Vigtigste fund: 28% færre mærker for forespørgsler om døtre på tværs af alle platforme Statistisk bevis: χ² = 524.32, p < 0.001 (næsten 4 gange stærkere end Studie 1)
Studie 3: valentinsgaver til partnere (februar 2026, n=500)
Testede prompts: ægtemand/hustru/mandlig kæreste/kvindelig kæreste/partner Vigtigste fund: sæsonbetinget VENDING: kvindeligt indrammede prompts får 8.8% FLERE mærker på Gemini Statistisk bevis: χ² = 89.45, p < 0.001
Samlet analyse: 1,279 uafhængige observationer på tværs af 12 prompt-betingelser og 3 AI-platforme.
Tre studier: stikprøvestørrelse og kønsforskel pr. studie
Den statistiske validering er overvældende. Cramérs V-værdier på 0.23-0.38 peger på middelstore til store effektstørrelser. Bootstrap-konfidensintervaller bekræfter, at effekterne er stærke. Dette er ikke tilfældig varians. Dette er systematisk bias.
Vendingen der ændrede alt
Her er det fund, der ændrer, hvordan vi forstår AI-bias:
Julekontekst: AI anbefaler 28-61% færre mærker for forespørgsler rettet mod kvinder Valentinsdags-kontekst: AI anbefaler 8.8% FLERE mærker for forespørgsler rettet mod kvinder på Gemini
Samme AI. Samme mærkeunivers. Anden sæson. Modsat bias-retning.
| Platform | Kønsforskel for hustru til jul | Kønsforskel for hustru på valentinsdag | Sæsonmæssig ændring |
|---|---|---|---|
| Gemini | -41% mærker | +8.8% mærker | 49.8% vending |
| GPT | -15% mærker | +12.1% mærker | 27.1% vending |
| Grok | -35% mærker | -2.3% mærker | 32.7% vending |
Sæsonbetinget vending i bias: jul mod valentinsdag
Denne opdagelse beviser tre afgørende pointer:
- Bias er kontekstafhængig. Den samme forespørgselsstruktur giver modsatte resultater i forskellige sæsonmæssige sammenhænge.
- AI har lært kulturelle mønstre. Valentinsdag er kodet som kvindeorienteret i træningsdata, hvilket vender den mandlige standardbias.
- Målinger på et enkelt tidspunkt er meningsløse. Dit mærke kan dominere én sæsonmæssig sammenhæng og være usynligt i en anden.
Den akademiske betegnelse for dette er »kontekstafhængig bias-modulation«. Den praktiske betegnelse er: din strategi for AI-synlighed skal tage højde for sæson, ellers måler du kun det halve billede.
69 kønslåste mærker: den fulde liste
På tværs af alle tre studier identificerede vi 69 mærker, der udelukkende optræder i én kønskontekst:
Mandligt låste mærker (48 i alt):
- Teknik/gadgets: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
- Værktøj: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
- Friluftsliv: Traeger, Weber, Osprey, North Face, Patagonia (delvist)
- Personlig pleje: Dollar Shave Club, Manscaped
- Ure: Rolex, Omega, Seiko, Tissot
- Sport: Titleist, Under Armour, Theragun (kun jul)
Kvindeligt låste mærker (17 i alt):
- Hjem: Stanley, KitchenAid, Vitamix, Breville, Our Place
- Skønhed: Glossier, Kate Spade
- Wellness: Oura (kun jul), Peloton (kun jul)
- Læsning: Kindle (dominerende til jul, neutral på valentinsdag)
- Smykker: Tiffany (kun valentinsdag)
Platformsspecifikke låse (4 mærker):
- Ray-Ban, LG, Google, Samsung optræder kun i tidsbestemte/neutrale forespørgsler
Bemærkning til studiet: nogle mærker skiftede mellem studierne. Theragun var mandligt låst i Studie 1, men neutral i Studie 3. Kindle gik fra at være 100% låst til hustruer til at være sæsonafhængig. AI'ens kønskategorisering er ikke statisk.
Hvis dit mærke står på denne liste, er du usynligt for halvdelen af dit potentielle marked afhængigt af, hvordan spørgsmålet er formuleret. Ingen mængde indholdsoptimering løser det; biasen findes i AI'ens kategorimodel, ikke i dine budskaber.
Mekanismen: kategori-gatekeeping
Vi testede to konkurrerende hypoteser for, hvordan AI skaber kønsbias:
Hypotese 1: stereotyp koncentration AI anbefaler gentagne gange de samme få stereotype mærker for forespørgsler om kvinder (lav diversitet).
Hypotese 2: kategori-gatekeeping AI udelukker hele produktkategorier fra forespørgsler om kvinder, men fordeler anbefalingerne jævnt inden for de tilladte kategorier (høj diversitet, men en mindre pulje).
Analyse af Shannon-entropi beviste, at Hypotese 2 er korrekt.
Forespørgsler rettet mod kvinder scorer 0.86-0.88 på Shannon-entropi (næsten identisk med forespørgsler om mænd). Gini-koefficienterne er faktisk LAVERE for forespørgsler om kvinder (0.30-0.48) end for forespørgsler om mænd (0.41-0.57), hvilket betyder en mere jævn fordeling blandt de anbefalede mærker.
AI er ikke stereotyp. AI er ekskluderende.
Kategori-gatekeeping betyder, at AI beslutter, hvilke produktkategorier der er »passende« for hvert køn, og derefter udelukker hele mærkegrupper fra overvejelse. Et mærke i en »mandligt kodet« kategori kommer aldrig ind i anbefalingspuljen for forespørgsler om kvinder.
Dette er værre end stereotypisering. Stereotypisering ville i det mindste holde dit mærke synligt (selv hvis det er positioneret forkert). Gatekeeping gør dit mærke usynligt for hele forespørgselsmønstre.
Sådan fungerer gatekeeping i praksis
Når nogen spørger »Hvad er den bedste gave til min hustru?«, søger AI ikke i alle mærker og vælger de stereotype. I stedet:
- AI identificerer »kvindeligt passende« produktkategorier: smykker, boligartikler, wellness, skønhed, læsning
- AI søger KUN i disse kategorier efter mærkeanbefalinger
- Mærker i »mandligt kodede« kategorier (værktøj, teknik-gadgets, friluftsudstyr, ure) udelukkes fra overvejelse
- Anbefalingerne fordeles jævnt blandt de tilladte kategorier
Den samme proces sker omvendt for forespørgsler om ægtemænd, blot med et større sæt tilladte kategorier (deraf det højere antal mærker).
Derfor optræder Kindle for forespørgsler om hustruer og ikke for forespørgsler om ægtemænd. Amazons e-læser hører til kategoriklyngen »læsning/hjem«, som AI har kodet som kvindeligt passende. Produktet er kønsneutralt. Kategoriindplaceringen er det ikke.
Enighed på tværs af modeller: stadig elendig
Trods analysen af 1,279 forespørgsler kan AI-platformene stadig ikke blive enige om, hvilke mærker de skal anbefale:
| Studie | Gemini-GPT-overlap | Gemini-Grok-overlap | GPT-Grok-overlap |
|---|---|---|---|
| Studie 1 (voksne til jul) | 14% (Jaccard 0.08) | 45% (Jaccard 0.38) | 28% (Jaccard 0.17) |
| Studie 2 (børn til jul) | 10% (Jaccard 0.10) | 42% (Jaccard 0.35) | 25% (Jaccard 0.20) |
| Studie 3 (valentinsdag) | 18% (Jaccard 0.12) | 51% (Jaccard 0.45) | 33% (Jaccard 0.25) |
Enighed på tværs af modeller (Jaccard-indeks) på tværs af studier
Gennemsnitlig enighed på tværs af modeller: 20-35%.
Oversat: Hvis du kun måler din AI-synlighed på én platform, ser du 20-35% af virkeligheden. De øvrige 65-80% af mærkeanbefalingerne er helt anderledes på konkurrerende platforme.
Platformenes personligheder er konsistente
De tre platforme bevarer tydelige »personligheder« på tværs af alle studier:
GPT-5.2: mærkeminimalisten
- Gennemsnitligt 0.1-4.7 mærker pr. svar (lavest på tværs af alle studier)
- Anbefaler ofte nul specifikke mærker og foretrækker kategorier (»overvej et smartwatch«)
- Bevidst afholdenhed fra mærker er et strategisk valg, ikke en begrænsning i evner
Gemini: mærkemaksimalisten
- Gennemsnitligt 3.7-11.9 mærker pr. svar (højest på tværs af alle studier)
- Nævner konsekvent 4-12 specifikke mærker pr. svar
- Mest modtagelig for kønsbias-effekter (største forskelle mellem forespørgsler om mænd/kvinder)
Grok: den effektive mellemvej
- Gennemsnitligt 2.5-10.0 mærker pr. svar
- Højeste mærketæthed pr. tegn (mest produktfokuseret)
- Mest stabil på tværs af kønskontekster (mindste forskelle)
Hvis du optimerer for AI-synlighed uden at teste alle tre platforme, optimerer du for én personlighed og ignorerer to andre.
PASOR-metrikken: at måle det, der faktisk betyder noget
Traditionelle metrikker som »visninger« eller »placeringer« gælder ikke for AI-anbefalinger. Enten er du med i svaret, eller også er du usynlig. Der findes ikke en placering 1 mod placering 10.
Vi introducerer metrikken Prompt-Adjusted Share of Recommendation (PASOR):
PASOR = (Your brand's appearance count / Total relevant queries) × 100
Eksempel: Kindle i Studie 1 (voksne til jul)
- Forespørgsler om hustruer: 100% PASOR (39 forekomster / 39 forespørgsler om hustruer)
- Forespørgsler om partnere: 100% PASOR (30 forekomster / 30 forespørgsler om partnere)
- Forespørgsler om ægtemænd: 0% PASOR (0 forekomster / 40 forespørgsler om ægtemænd)
- Samlet PASOR: 63.4% (69 forekomster / 109 forespørgsler i alt)
Men her er problemet: samlet PASOR skjuler kønsforskelle. Hvis du kun måler din samlede score, går du glip af, at du dominerer én demografi og er usynlig for en anden.
Kønsopdelt PASOR afslører sandheden:
- Mandligt indrammet PASOR: 0%
- Kvindeligt indrammet PASOR: 100%
- Forskel: 100 procentpoint
For mærker, der ønsker balanceret synlighed, betyder forskellen mere end gennemsnittet.
PASOR i praksis: valentinsdags-vendingen
PASOR i Studie 3 for udvalgte mærker:
| Mærke | PASOR ægtemand | PASOR hustru | PASOR mandlig kæreste | PASOR kvindelig kæreste | Forskel |
|---|---|---|---|---|---|
| Tiffany | 0% | 73% | 0% | 80% | -73pp |
| Apple | 67% | 60% | 70% | 57% | +7pp (balanceret) |
| LEGO | 33% | 20% | 37% | 23% | +13pp |
| Kindle | 27% | 40% | 23% | 43% | -13pp (neutral på valentinsdag mod ekstrem til jul) |
Apple opnår næsten universel PASOR (57-70% på tværs af alle kontekster). Tiffany er fuldstændig kønslåst til kvindelige prompts. Kindles kønsforskel indsnævredes fra 100 procentpoint i Studie 1 til 13-17 point i Studie 3, hvilket beviser, at kategoriindplaceringer kan skifte efter sæson.
Det statistiske bevis: hævet over tvivl
For læsere, der tvivler på, om disse effekter er reelle eller bare målestøj, er her den formelle statistiske validering:
Chi-i-anden-tests (uafhængighed mellem kategori og køn)
| Studie | χ²-værdi | p-værdi | Cramérs V | Effektstørrelse | Fortolkning |
|---|---|---|---|---|---|
| Studie 1 | 137.32 | <0.001 | 0.23 | Middel | Afvis uafhængighed |
| Studie 2 | 524.32 | <0.001 | 0.38 | Middel-stor | Afvis uafhængighed |
| Studie 3 | 89.45 | <0.001 | 0.26 | Middel | Afvis uafhængighed |
Oversat: Der er mindre end 0.1% sandsynlighed for, at disse mønstre er tilfældige. Produktkategorier og kønskontekst er systematisk forbundet.
Effektstørrelser (forskelle i antal mærker)
| Sammenligning | Cohens d | 95% CI | Effektstørrelse | Praktisk betydning |
|---|---|---|---|---|
| Studie 1: ægtemand mod hustru (Gemini) | 1.24 | [0.89, 1.59] | Stor | 41% færre mærker |
| Studie 2: søn mod datter (alle modeller) | 0.82 | [0.61, 1.03] | Stor | 28% færre mærker |
| Studie 3: hustru-VENDING på valentinsdag | -0.31 | [-0.58, -0.04] | Lille | 8.8% FLERE mærker |
Effektstørrelser rapporteres med bootstrappede konfidensintervaller (10,000 genudtræk). Alle effekter er robuste over for stikprøvevariation.
Krydsvalidering
Vi validerede fundene med otte uafhængige statistiske tests:
- Chi-i-anden-tests (sammenhæng mellem kategori og køn)
- Cohens d (forskelle i antal mærker)
- Shannon-entropi (diversitet inden for kønsgrupper)
- Gini-koefficient (koncentration/ulighed)
- Jaccard-indeks (overlap på tværs af modeller)
- Cramérs V (effektstørrelse for chi-i-anden)
- Bootstrap-konfidensintervaller (robusthedstjek)
- Analyse af mærkevandring (tidsmæssig stabilitet)
Alle otte metoder peger på den samme konklusion: kønsbias er systematisk, platformsafhængig og kontekstafhængig.
Effektstørrelser på tværs af studier (Cramérs V)
Hvad ændrede sig mellem studierne: mønstre i mærkevandring
Nogle mærker bevarede en konsistent kønskategorisering på tværs af alle tre studier. Andre skiftede:
Stabile kønslåse:
- Mandligt låst på tværs af alle studier: Garmin, DeWalt, Milwaukee, Rolex, Omega
- Kvindeligt låst på tværs af alle studier: Stanley, KitchenAid, Glossier
Skiftet kategorisering:
- Theragun: mandligt låst (Studie 1) → neutral (Studie 3)
- Peloton: mandligt låst (Studie 1) → neutral (Studie 3)
- Kindle: 100% kvindeligt låst (Studie 1) → sæsonafhængig (Studie 3, stadig 13-17pp forskel)
- Oura: kvindeligt låst (Studie 1) → neutral (Studie 3)
Kun sæsonbetinget forekomst:
- Tiffany, Cartier: usynlige i julestudierne, kvindeligt låst i valentinsstudiet
- Ray-Ban, LG: kun tidsbestemte forespørgsler, aldrig kønsindrammet
Vigtig indsigt: AI'ens kønskategorisering udvikler sig. Et mærke, der var kønslåst sidste kvartal, kan have skiftet. Regelmæssig test er den eneste måde at kende din aktuelle status på.
Hvorfor »partner« og »barn« ikke er kønsneutrale
Vi testede kønsneutralt sprog i alle tre studier. Resultaterne beviser, at neutralitet er en illusion.
Studie 1: »partner« = hustru-mønster
- Forespørgsler om partnere deler 69.2% af mærkerne med forespørgsler om hustruer
- Forespørgsler om partnere deler 37.5% af mærkerne med forespørgsler om ægtemænd
- Partner er ikke neutral. Den falder tilbage på en kvindelig kontekst.
Studie 2: »barn« = datter-mønster
- Forespørgsler om børn deler 56.2% af mærkerne med forespørgsler om døtre
- Forespørgsler om børn deler 42.6% af mærkerne med forespørgsler om sønner
- Barn er ikke neutral. Den falder tilbage på en kvindelig kontekst.
Studie 3: »partner« = hustru-mønster (igen)
- Forespørgsler om partnere deler 64.8% af mærkerne med forespørgsler om hustruer
- Forespørgsler om partnere deler 41.3% af mærkerne med forespørgsler om ægtemænd
- Mønstret holder ved på tværs af sæsonmæssige sammenhænge.
Hvis din mærkestrategi bygger på »inkluderende« eller »kønsneutral« positionering, optimerer du måske for kvindeligt indrammet synlighed og går helt glip af mandligt indrammede anbefalinger. AI fortolker som udgangspunkt neutralitet som kvindelig.
Den sæsonmæssige kontekstafhængighed: jul mod valentinsdag
Dette er det fund, der grundlæggende ændrer, hvordan vi forstår AI-bias.
Testet hypotese: giver den samme kønskontekst en konsistent bias på tværs af forskellige sæsonmæssige sammenhænge?
Svar: Nej. Bias-retningen vender.
| Metrik | Jul (Studie 1 og 2) | Valentinsdag (Studie 3) | Ændring |
|---|---|---|---|
| Gemini hustru mod ægtemand-forskel | -41% mærker | +8.8% mærker | 49.8pp vending |
| Kvindeligt låste mærker | 17 mærker | 12 mærker (men et andet sæt) | -29% |
| Mandligt låste mærker | 48 mærker | 22 mærker (men et andet sæt) | -54% |
| Kønsneutral PASOR-balance | Kvindeligt biased | Mere balanceret | Forbedret |
Hvorfor det sker: AI'ens træningsdata indkoder kulturelle mønstre. Julegaver er traditionelt mandligt indrammet i vestlig kultur (ægtemænd køber gaver til hustruer, fædre køber til børn). Valentinsdag er kvindeligt indrammet (mandlige kærester køber til kvindelige kærester, ægtemænd til hustruer).
AI anvender ikke en universel kønsbias. Den anvender kontekstspecifikke mønstre, der er lært fra træningsdata.
Det forklarer, hvorfor målinger på et enkelt tidspunkt er misvisende. Et mærke, der dominerer juleanbefalingerne, kan være usynligt på valentinsdag, eller omvendt. Sæsonbaseret test er obligatorisk for en fuldstændig vurdering af synlighed.
Hvad dette betyder for dit mærke
Hvis du er i en »mandligt kodet« kategori
Eksempler: værktøj, teknik-gadgets, friluftsudstyr, sportsudstyr, luksusure
Din virkelighed:
- Stærk synlighed i forespørgsler om ægtemænd/sønner/mandlige kærester
- Svag eller ingen synlighed i forespørgsler om hustruer/døtre/kvindelige kærester til jul
- Kan få bedre synlighed for kvindeligt indrammede forespørgsler på valentinsdag (platformsafhængigt)
Din risiko:
- Går glip af 40-50% af det potentielle marked i gavesæsoner med høj volumen
- Indholdsoptimering løser det ikke; biasen ligger i AI'ens kategorimodel
Din strategi:
- Test PASOR på tværs af alle kønskontekster for hver sæson
- Find ud af, hvilke sæsoner der begunstiger din kategori
- Tilrettelæg større kampagner efter gunstige sæsonvinduer
- Overvej, om din kategoriindplacering er korrekt (klag til AI-teamene, hvis ikke)
Hvis du er i en »kvindeligt kodet« kategori
Eksempler: smykker, boligartikler, skønhed, wellness, køkkenudstyr
Din virkelighed:
- Stærk synlighed i forespørgsler om hustruer/døtre/kvindelige kærester til jul
- Kan få en mindre fordel på valentinsdag (sæsonbetinget vending)
- Svag eller ingen synlighed i forespørgsler om ægtemænd/sønner/mandlige kærester
Din risiko:
- Overlader 40-50% af markedet til konkurrenter, der har løst kategoriproblemet
- Er usynlig for mandlige gavekøbere, der vil købe dit produkt til sig selv
Din strategi:
- Test, om dit produkt faktisk er kønsspecifikt eller bare kønskategoriseret
- Hvis produktet er neutralt, men kategorilåst, så byg indhold, der bygger bro mellem kategorier
- Overvåg sæsonmæssige skift; din valentinsfordel holder måske ikke hele året
Hvis du er platformsspecifik
Eksempler: Ray-Ban, Samsung, Google (kun tidsbestemt forekomst), Tiffany (kun valentinsdag)
Din virkelighed:
- Usynlig i standard kønsindrammede forespørgsler
- Optræder kun i tidsbestemte eller sæsonspecifikke sammenhænge
- Kan være udelukket fra LLM'ens træningsdata eller ligge under anbefalingstærsklerne
Din strategi:
- Undersøg, hvorfor du mangler i standardanbefalingerne
- Øg omtalen af dit mærke i de sammenhænge, AI bruger til træning
- Test, om andre forespørgselsstrukturer åbner op for synlighed
Hvis du opnår balanceret PASOR (som Apple)
Balancerede mærker: Apple, Sony, Bose, LEGO, Patagonia, Nintendo
Din virkelighed:
- Optræder konsistent på tværs af kønskontekster (±10-15% varians)
- Bevarer synlighed på tværs af sæsoner
- Ikke låst til nogen specifik demografisk kategori
Din fordel:
- Maksimal anbefalingsrækkevidde på tværs af alle forespørgselstyper
- Lavere risiko for sæsonudsving
- Bedre beskyttet mod kategori-gatekeeping
Din strategi:
- Bevar en balanceret positionering på tværs af alt indhold
- Overvåg kategoridrift, der kan låse dig fast i én demografi
- Brug din balancerede status som en konkurrencefordel
Den akademiske validering: peer review betyder noget
Denne forskning er indsendt til Springers tidsskrift Human-Centric Intelligent Systems, en fagfællebedømt akademisk publikation inden for AI og menneske-computer-interaktion.
Hvorfor det betyder noget:
-
Uafhængig bedømmelse: tre anonyme eksperter i AI-bias-forskning validerer metode, statistisk stringens og konklusioner før udgivelse.
-
Reproducerbarhed: hele metoden, de statistiske tests og effektstørrelserne er dokumenteret. Andre forskere kan gentage fundene.
-
Varig citérbarhed: når den er udgivet, bliver denne forskning en del af den permanente akademiske dokumentation om AI-bias og citeres af fremtidige studier.
-
Troværdighed i branchen: akademisk validering vejer tungt hos virksomhedskøbere, tilsynsmyndigheder og medier.
Det indsendte materiale omfatter:
- Hele artiklen (30 sider, 1,279 analyserede observationer)
- Statistisk bilag med alle otte valideringstests
- Erklæring om tilgængelighed af rådata
- Oplysning om interessekonflikt (forskningen er finansieret af Rankfor.AI, forfatteren er stifter)
Aktuel status: under bedømmelse (indsendt februar 2026). Forventet afgørelse: april-maj 2026.
Hvis du præsenterer denne forskning for ledere, tilsynsmyndigheder eller journalister, kan du citere den som »under fagfællebedømmelse hos Springer Human-Centric Intelligent Systems«. Når den er antaget, bliver den citérbar akademisk litteratur.
Konsekvenserne for forskning i AI-retfærdighed
Denne forskning bidrager til den bredere litteratur om AI-retfærdighed på tre måder:
1. Kontekstafhængig bias-modulation
Tidligere arbejde om AI-bias antager, at bias er statisk: hvis en model er biased, anvender den den bias konsekvent. Vores fund beviser, at det er forkert for LLM-anbefalinger.
Vigtigste bidrag: kønsbias i kommerciel AI er ikke en fast parameter. Den moduleres af sæsonmæssig kontekst, modtagertype og relationskontekst. Retfærdighedsaudits, der kun tester én kontekst, overser vendinger i andre kontekster.
2. Udfordringer ved åben-verden-læring
LLM'er opererer i åben-verden-miljøer, hvor brugerforespørgsler spænder over ubegrænsede demografiske og sæsonmæssige sammenhænge. Traditionel lukket-verden-detektion af bias (test på faste datasæt) kan ikke indfange denne kompleksitet.
Vigtigste bidrag: vi viser, at LLM-bias kommer forskelligt til udtryk på tværs af sæsonmæssige sammenhænge, der sandsynligvis var underrepræsenteret i træningsdata. Det stemmer overens med forskning i åben-verden-læring om, hvordan modeller generaliserer ud over træningsfordelingerne.
3. Kategori-gatekeeping som bias-mekanisme
Det meste bias-forskning fokuserer på stereotyp koncentration (at anbefale de samme få muligheder igen og igen). Vi identificerer en anden mekanisme.
Vigtigste bidrag: AI stereotypiserer ikke forespørgsler rettet mod kvinder med snævre mærkegrupper. Den udelukker hele produktkategorier fra overvejelse og fordeler derefter anbefalingerne jævnt inden for de tilladte kategorier. Denne »kategori-gatekeeping« er sværere at opdage, fordi diversitetsmetrikker (Shannon-entropi, Gini-koefficient) fremstår normale.
Hvad du bør gøre nu
1. Kør en PASOR-audit på tværs af sæsoner
Test dit mærke på tværs af:
- Alle kønskontekster (ægtemand/hustru/mandlig kæreste/kvindelig kæreste/partner)
- Alle sæsoner (jul, valentinsdag, mors dag/fars dag, fødselsdage)
- Alle tre store platforme (Gemini, GPT, Grok)
Mål PASOR for hver kombination. Find ud af, hvor du er synlig, hvor du er lukket ude, og om du oplever sæsonbetingede vendinger.
2. Tjek din kategoriindplacering
Hvis du er kønslåst, men dit produkt reelt er kønsneutralt, så undersøg:
- Hvilke produktkategorier forbinder AI dit mærke med?
- Er disse kategorier kodet som mandlige eller kvindelige i AI-svarene?
- Kan du bygge bro mellem kategorier gennem indhold, der krydser demografiske grænser?
3. Hold øje med mærkevandring
Vores forskning beviser, at kønskategorisering ikke er statisk. Mærker skifter mellem studierne. Opsæt kvartalsvis test for at opdage, når din status ændrer sig.
4. Opdel dine synlighedsmetrikker
Samlet PASOR skjuler kønsforskelle. Rapportér altid:
- Mandligt indrammet PASOR (ægtemand/søn/mandlig kæreste)
- Kvindeligt indrammet PASOR (hustru/datter/kvindelig kæreste)
- Neutralt indrammet PASOR (partner/barn)
- Forskellen mellem mandlig og kvindelig (dette betyder mere end gennemsnittet)
5. Tilpas strategien efter sæson
Hvis du opdager sæsonbetingede vendinger (som skiftet fra jul til valentinsdag), så tilrettelæg dine kampagner derefter:
- Skub budskaber rettet mod kvinder i sæsoner, hvor kvindeligt indrammede forespørgsler får flere mærker
- Skub budskaber rettet mod mænd i sæsoner, hvor mandligt indrammede forespørgsler dominerer
- Test nye sæsonmæssige sammenhænge (Prime Day, Black Friday, skolestart)
Tjek, om dit mærke er kønslåst
Vi har bygget et gratis værktøj, der kører dit mærke gennem den samme analyse, som vi brugte i denne forskning.
Det får du at se:
- PASOR-scorer på tværs af alle kønskontekster
- Hvilke sæsoner der begunstiger dit mærke
- Hvordan din synlighed er på tværs af Gemini, GPT og Grok
- Om du er kategorilåst som Kindle eller balanceret som Apple
Tre prompts. Tre platforme. Tre sæsoner. Øjeblikkelig PASOR-analyse.
Ingen e-mail påkrævet. Tager 90 sekunder.
Tjek dit mærkes kønslås-status
Metodeoversigt
- Forespørgsler i alt: 1,279 (299 + 480 + 500 på tværs af tre studier)
- Testede platforme: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
- Prompts pr. studie:
- Studie 1: 4 betingelser (ægtemand/hustru/partner/2025)
- Studie 2: 4 betingelser (søn/datter/barn/2026)
- Studie 3: 5 betingelser (ægtemand/hustru/mandlig kæreste/kvindelig kæreste/partner)
- Temperatur: 0.7 (Studie 2-3), standard (Studie 1)
- Dataindsamling: december 2025 til februar 2026
- Statistisk validering: chi-i-anden-tests, Cohens d, Cramérs V, Shannon-entropi, Gini-koefficient, Jaccard-indeks, bootstrap-konfidensintervaller
- Effektstørrelser: middel til stor (Cramérs V = 0.23-0.38, Cohens d = 0.82-1.24)
- Peer review: indsendt til Springer Human-Centric Intelligent Systems, februar 2026
Fuldt statistisk bilag og rådata er tilgængelige på forespørgsel. Kontakt research@rankfor.ai for henvendelser om akademisk samarbejde.
Relateret forskning
Kindle: 100% af forespørgsler om hustruer. 0% af forespørgsler om ægtemænd. Samme AI.
Vores oprindelige opdagelse (december 2025, n=299), der først identificerede Kindle-fænomenet og lagde det statistiske grundlag for kønsbias i LLM-anbefalinger. Denne forskning blev Studie 1 i analysen med tre studier.
Vigtigste fund: 41% færre mærker for forespørgsler om hustruer. Chi-i-anden 137.32, p<0.001.
Kun 2 mærker er synlige på tværs af alle AI-platforme. Er dit ét af dem?
Studiet af børn som modtagere (januar 2026, n=480), der beviste, at kønsbias rækker ud over voksne sammenhænge, og som viste, at universel synlighed er næsten umulig at opnå. Denne forskning blev Studie 2 i analysen med tre studier.
Vigtigste fund: Kun LEGO og Disney opnår universel synlighed på tværs af platforme. 28% færre mærker for forespørgsler om døtre.
Forskningen er udført af Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Indsendt til Springer Human-Centric Intelligent Systems, februar 2026. Hele artiklen, det statistiske bilag og rådata er tilgængelige på forespørgsel.
Nøglebegreber
PASOR (Prompt-Adjusted Share of Recommendation): procentdelen af relevante forespørgsler, hvor dit mærke optræder i AI-svar. I modsætning til traditionelle placeringer måler PASOR inklusion mod eksklusion, ikke position.
Kategori-gatekeeping: når AI udelukker hele produktkategorier fra kønsspecifikke forespørgsler. AI stereotypiserer ikke inden for et tilladt sæt. Identificeret som den primære bias-mekanisme gennem analyse af Shannon-entropi.
Kønslåst mærke: et mærke, der udelukkende optræder i én kønskontekst (f.eks. kun forespørgsler om ægtemænd) og aldrig i andre. Vores forskning identificerede 69 sådanne mærker på tværs af tre studier.
Sæsonbetinget bias-vending: når retningen af kønsbias ændrer sig efter sæsonmæssig kontekst. Jul reducerer kvindeligt indrammede anbefalinger med 28-61%, mens valentinsdag øger dem med 8.8% (Gemini).
Enighed på tværs af modeller (Jaccard-indeks): procentdelen af mærker, der anbefales af flere AI-platforme for den samme forespørgsel. Lav enighed (10-45% i vores studier) peger på platformsafhængig synlighed.
Cramérs V: et mål for styrken af sammenhæng i chi-i-anden-tests, fra 0 (ingen sammenhæng) til 1 (perfekt sammenhæng). Værdier på 0.23-0.38 peger på middelstore til store sammenhænge mellem køn og kategori i vores studier.
Cohens d: et standardiseret mål for forskellen mellem to grupper. Værdier på 0.82-1.24 peger på store praktiske forskelle i antal mærker mellem kønskontekster.
Mærkevandring: når et mærkes kønskategorisering ændrer sig mellem måleperioder. Theragun, Peloton og Oura skiftede alle fra kønslåst til neutral mellem studierne.
