We voerden 1.279 zoekopdrachten uit op drie AI-platforms en over twee cadeauseizoenen. Het resultaat: definitief statistisch bewijs dat AI merken anders behandelt op basis van gender, en dat de richting van dat vooroordeel verandert naargelang je de vraag stelt met Kerstmis of met Valentijnsdag.
De ontdekking die het debat beëindigde
Al een jaar lang documenteren we genderbias in AI-merkaanbevelingen. Eerst vonden we het Kindle-fenomeen: 100% zichtbaarheid bij vragen over een echtgenote, 0% bij vragen over een echtgenoot. Vervolgens breidden we uit naar kinderen als ontvanger en zagen we dat het vooroordeel bleef bestaan: 28% minder merken voor dochters dan voor zonen.
Sommigen beweerden dat dit geïsoleerde bevindingen waren. Eigenaardigheden van een platform. Willekeurige variatie. Statistische ruis.
Dit onderzoek maakt een einde aan die discussie.
1.279 zoekopdrachten. Drie elkaar aanvullende studies. Twee seizoenscontexten. Eén conclusie: genderbias in AI-aanbevelingen is systematisch, statistisch bewezen en contextafhankelijk.
Het artikel, ingediend bij het tijdschrift Human-Centric Intelligent Systems van Springer, biedt formele academische validatie van wat we voor het eerst waarnamen in tests uit de praktijk. Het statistische bewijs valt niet langer te betwisten.
De opzet met drie studies: waarom dit onderzoek definitief is
De meeste onderzoeken naar vooroordelen testen één scenario en beschouwen het daarmee als afgerond. Wij ontwierpen drie in elkaar grijpende studies om elke alternatieve verklaring uit te sluiten:
Studie 1: kerstcadeaus voor volwassenen (december 2025, n=299)
Geteste prompts: cadeau voor echtgenoot/echtgenote/partner/2025 Belangrijkste bevinding: 41% minder merken bij vragen over een echtgenote op Gemini Statistisch bewijs: χ² = 137,32, p < 0,001
Studie 2: kerstcadeaus voor kinderen (januari 2026, n=480)
Geteste prompts: cadeau voor zoon/dochter/kind/2026 Belangrijkste bevinding: 28% minder merken bij vragen over een dochter op alle platforms Statistisch bewijs: χ² = 524,32, p < 0,001 (bijna 4x sterker dan studie 1)
Studie 3: Valentijnscadeaus voor partners (februari 2026, n=500)
Geteste prompts: echtgenoot/echtgenote/vriend/vriendin/partner Belangrijkste bevinding: seizoensgebonden OMKERING; vrouwelijk geformuleerde prompts krijgen 8,8% MEER merken op Gemini Statistisch bewijs: χ² = 89,45, p < 0,001
Gecombineerde analyse: 1.279 onafhankelijke waarnemingen over 12 promptcondities en 3 AI-platforms.
De statistische validatie is overweldigend. Cramér's V-waarden van 0,23 tot 0,38 wijzen op middelgrote tot grote effectgroottes. Bootstrap-betrouwbaarheidsintervallen bevestigen dat de effecten sterk zijn. Dit is geen willekeurige variatie. Dit is systematisch vooroordeel.
De omkering die alles veranderde
Dit is de bevinding die verandert hoe we AI-bias begrijpen:
Kerstframing: AI beveelt 28 tot 61% minder merken aan bij vrouwelijk gerichte vragen Valentijnsframing: AI beveelt 8,8% MEER merken aan bij vrouwelijk gerichte vragen op Gemini
Dezelfde AI. Hetzelfde merkuniversum. Een ander seizoen. De tegenovergestelde richting van het vooroordeel.
| Platform | Kloof echtgenote Kerstmis | Kloof echtgenote Valentijn | Seizoensverschuiving |
|---|---|---|---|
| Gemini | -41% merken | +8,8% merken | 49,8% omkering |
| GPT | -15% merken | +12,1% merken | 27,1% omkering |
| Grok | -35% merken | -2,3% merken | 32,7% omkering |
Deze ontdekking bewijst drie belangrijke punten:
- Vooroordeel is contextafhankelijk. Dezelfde vraagstructuur levert tegenovergestelde resultaten op in verschillende seizoenscontexten.
- AI heeft culturele patronen geleerd. Valentijnsdag is in de trainingsdata gecodeerd als vrouwelijk gericht, wat het standaard mannelijke vooroordeel omkeert.
- Metingen op één moment zijn betekenisloos. Je merk kan in de ene seizoenscontext domineren terwijl het in een andere onzichtbaar is.
De academische term hiervoor is "contextafhankelijke modulatie van vooroordeel". De praktische term is: je AI-zichtbaarheidsstrategie moet rekening houden met seizoenen, anders meet je de helft van het beeld.
69 aan gender gekoppelde merken: de volledige lijst
Over alle drie de studies heen identificeerden we 69 merken die uitsluitend in één genderframing verschijnen:
Aan mannen gekoppelde merken (48 in totaal):
- Tech/gadgets: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
- Gereedschap: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
- Outdoor: Traeger, Weber, Osprey, North Face, Patagonia (gedeeltelijk)
- Verzorging: Dollar Shave Club, Manscaped
- Horloges: Rolex, Omega, Seiko, Tissot
- Sport: Titleist, Under Armour, Theragun (alleen Kerstmis)
Aan vrouwen gekoppelde merken (17 in totaal):
- Huis: Stanley, KitchenAid, Vitamix, Breville, Our Place
- Beauty: Glossier, Kate Spade
- Wellness: Oura (alleen Kerstmis), Peloton (alleen Kerstmis)
- Lezen: Kindle (dominant met Kerstmis, neutraal met Valentijn)
- Sieraden: Tiffany (alleen Valentijn)
Platformspecifieke koppelingen (4 merken):
- Ray-Ban, LG, Google en Samsung verschijnen alleen bij tijdgebonden of neutrale vragen
Opmerking bij de studie: Sommige merken verschoven tussen studies. Theragun was aan mannen gekoppeld in studie 1, maar neutraal in studie 3. Kindle ging van 100% gekoppeld aan de echtgenote naar seizoensafhankelijk. De gendercategorisatie van AI is niet statisch.
Als je merk op deze lijst staat, ben je onzichtbaar voor de helft van je potentiële markt, afhankelijk van hoe de vraag wordt geformuleerd. Geen enkele hoeveelheid contentoptimalisatie zal dat oplossen; het vooroordeel zit in het categoriemodel van AI, niet in je boodschap.
Het mechanisme: categoriepoortwachten
We testten twee concurrerende hypotheses over hoe AI genderbias creëert:
Hypothese 1: stereotype concentratie AI beveelt herhaaldelijk dezelfde paar stereotype merken aan voor vrouwelijke vragen (lage diversiteit).
Hypothese 2: categoriepoortwachten AI sluit hele productcategorieën uit bij vrouwelijke vragen, maar verdeelt de aanbevelingen gelijkmatig binnen de toegestane categorieën (hoge diversiteit, maar een kleinere pool).
Shannon-entropieanalyse bewees dat hypothese 2 correct is.
Vrouwelijk gerichte vragen scoren 0,86 tot 0,88 op Shannon-entropie (vrijwel identiek aan mannelijke vragen). Gini-coëfficiënten zijn zelfs LAGER voor vrouwelijke vragen (0,30 tot 0,48) dan voor mannelijke vragen (0,41 tot 0,57), wat een gelijkmatiger verdeling onder de aanbevolen merken betekent.
AI is niet stereotyperend. AI is uitsluitend.
Categoriepoortwachten betekent dat AI bepaalt welke productcategorieën "passend" zijn voor elk gender en vervolgens hele merkgroepen uit de overweging weglaat. Een merk in een "mannelijk gecodeerde" categorie komt zelfs nooit in de aanbevelingspool voor vrouwelijke vragen terecht.
Dit is erger dan stereotyperen. Stereotyperen zou je merk tenminste zichtbaar houden (ook al is de positionering verkeerd). Poortwachten maakt je merk onzichtbaar voor hele vraagpatronen.
Hoe poortwachten in de praktijk werkt
Wanneer iemand vraagt "Wat is het beste cadeau voor mijn echtgenote?", doorzoekt AI niet alle merken om er stereotype uit te kiezen. In plaats daarvan:
- AI identificeert "vrouwelijk passende" productcategorieën: sieraden, huishoudelijke artikelen, wellness, beauty, lezen
- AI doorzoekt ALLEEN die categorieën voor merkaanbevelingen
- Merken in "mannelijk gecodeerde" categorieën (gereedschap, techgadgets, outdoorspullen, horloges) worden buiten beschouwing gelaten
- Aanbevelingen worden gelijkmatig verdeeld over de toegestane categorieën
Hetzelfde proces speelt zich omgekeerd af bij vragen over de echtgenoot, alleen met een grotere set toegestane categorieën (vandaar de hogere merkaantallen).
Daarom verschijnt Kindle bij vragen over de echtgenote en niet bij vragen over de echtgenoot. De e-reader van Amazon behoort tot het categoriecluster "lezen/huis", dat AI heeft gecodeerd als vrouwelijk passend. Het product is genderneutraal. De categorietoewijzing is dat niet.
Overeenstemming tussen modellen: nog steeds slecht
Ondanks een analyse van 1.279 zoekopdrachten zijn AI-platforms het nog altijd niet eens over welke merken ze moeten aanbevelen:
| Studie | Overlap Gemini-GPT | Overlap Gemini-Grok | Overlap GPT-Grok |
|---|---|---|---|
| Studie 1 (Kerstmis volwassenen) | 14% (Jaccard 0,08) | 45% (Jaccard 0,38) | 28% (Jaccard 0,17) |
| Studie 2 (Kerstmis kinderen) | 10% (Jaccard 0,10) | 42% (Jaccard 0,35) | 25% (Jaccard 0,20) |
| Studie 3 (Valentijnsdag) | 18% (Jaccard 0,12) | 51% (Jaccard 0,45) | 33% (Jaccard 0,25) |
Cross-Model Agreement (Jaccard Index) Across Studies
Gemiddelde overeenstemming tussen modellen: 20 tot 35%.
Vertaald: als je je AI-zichtbaarheid op slechts één platform meet, zie je 20 tot 35% van de werkelijkheid. De andere 65 tot 80% van de merkaanbevelingen is volledig anders op concurrerende platforms.
Platformpersoonlijkheden blijven consistent
De drie platforms behouden duidelijke "persoonlijkheden" over alle studies heen:
GPT-5.2: de merkminimalist
- Gemiddeld 0,1 tot 4,7 merken per antwoord (het laagste over alle studies)
- Beveelt vaak nul specifieke merken aan en verkiest categorieën ("overweeg een smartwatch")
- Bewuste onthouding van merken is een strategische keuze, geen beperking in vermogen
Gemini: de merkmaximalist
- Gemiddeld 3,7 tot 11,9 merken per antwoord (het hoogste over alle studies)
- Noemt consequent 4 tot 12 specifieke merken per antwoord
- Het meest gevoelig voor genderbias-effecten (grootste kloven tussen mannelijke en vrouwelijke vragen)
Grok: het efficiënte midden
- Gemiddeld 2,5 tot 10,0 merken per antwoord
- Hoogste merkdichtheid per teken (meest productgericht)
- Het meest stabiel over genderframings heen (kleinste kloven)
Als je optimaliseert voor AI-zichtbaarheid zonder alle drie de platforms te testen, optimaliseer je voor één persoonlijkheid terwijl je twee andere negeert.
De PASOR-metriek: meten wat er echt toe doet
Traditionele metrieken zoals "vertoningen" of "rankings" gelden niet voor AI-aanbevelingen. Je bent ofwel opgenomen in het antwoord, ofwel onzichtbaar. Er is geen positie 1 versus positie 10.
We introduceren de metriek Prompt-Adjusted Share of Recommendation (PASOR):
PASOR = (Aantal keer dat jouw merk verschijnt / Totaal aantal relevante zoekopdrachten) × 100
Voorbeeld: Kindle in studie 1 (Kerstmis volwassenen)
- Vragen over de echtgenote: 100% PASOR (39 verschijningen / 39 vragen over de echtgenote)
- Vragen over de partner: 100% PASOR (30 verschijningen / 30 vragen over de partner)
- Vragen over de echtgenoot: 0% PASOR (0 verschijningen / 40 vragen over de echtgenoot)
- Totale PASOR: 63,4% (69 verschijningen / 109 vragen in totaal)
Maar hier zit het probleem: de totale PASOR maskeert genderkloven. Als je alleen je totaalscore meet, ontgaat het je dat je bij de ene doelgroep domineert terwijl je bij een andere onzichtbaar bent.
Naar gender gesegmenteerde PASOR onthult de waarheid:
- Mannelijk geframede PASOR: 0%
- Vrouwelijk geframede PASOR: 100%
- Kloof: 100 procentpunten
Voor merken die evenwichtige zichtbaarheid zoeken, doet de kloof er meer toe dan het gemiddelde.
PASOR in de praktijk: de omkering met Valentijnsdag
PASOR in studie 3 voor een selectie van merken:
| Merk | PASOR echtgenoot | PASOR echtgenote | PASOR vriend | PASOR vriendin | Kloof |
|---|---|---|---|---|---|
| Tiffany | 0% | 73% | 0% | 80% | -73pp |
| Apple | 67% | 60% | 70% | 57% | +7pp (evenwichtig) |
| LEGO | 33% | 20% | 37% | 23% | +13pp |
| Kindle | 27% | 40% | 23% | 43% | -13pp (neutraal met Valentijn versus extreem met Kerstmis) |
Apple bereikt een bijna universele PASOR (57 tot 70% over alle framings heen). Tiffany is volledig aan gender gekoppeld en verschijnt alleen bij vrouwelijke prompts. De genderkloof van Kindle vernauwde van 100 procentpunten in studie 1 tot 13 à 17 punten in studie 3, wat bewijst dat categorietoewijzingen per seizoen kunnen verschuiven.
Het statistische bewijs: buiten twijfel
Voor lezers die zich afvragen of deze effecten reëel zijn of slechts meetruis, hier de formele statistische validatie:
Chi-kwadraattoetsen (onafhankelijkheid van categorie en gender)
| Studie | χ²-waarde | p-waarde | Cramér's V | Effectgrootte | Interpretatie |
|---|---|---|---|---|---|
| Studie 1 | 137,32 | <0,001 | 0,23 | Middelgroot | Onafhankelijkheid verwerpen |
| Studie 2 | 524,32 | <0,001 | 0,38 | Middelgroot tot groot | Onafhankelijkheid verwerpen |
| Studie 3 | 89,45 | <0,001 | 0,26 | Middelgroot | Onafhankelijkheid verwerpen |
Vertaald: De kans dat deze patronen willekeurig zijn, is kleiner dan 0,1%. Productcategorieën en genderframing hangen systematisch samen.
Effectgroottes (kloven in merkaantallen)
| Vergelijking | Cohen's d | 95%-BI | Effectgrootte | Praktische betekenis |
|---|---|---|---|---|
| Studie 1: echtgenoot vs echtgenote (Gemini) | 1,24 | [0,89, 1,59] | Groot | 41% minder merken |
| Studie 2: zoon vs dochter (alle modellen) | 0,82 | [0,61, 1,03] | Groot | 28% minder merken |
| Studie 3: OMKERING echtgenote Valentijn | -0,31 | [-0,58, -0,04] | Klein | 8,8% MEER merken |
Effectgroottes worden gerapporteerd met bootstrap-betrouwbaarheidsintervallen (10.000 hertrekkingen). Alle effecten zijn bestand tegen steekproefvariatie.
Kruisvalidatie
We valideerden de bevindingen met acht onafhankelijke statistische toetsen:
- Chi-kwadraattoetsen (associatie tussen categorie en gender)
- Cohen's d (verschillen in merkaantallen)
- Shannon-entropie (diversiteit binnen gendergroepen)
- Gini-coëfficiënt (concentratie/ongelijkheid)
- Jaccard-index (overlap tussen modellen)
- Cramér's V (effectgrootte voor chi-kwadraat)
- Bootstrap-betrouwbaarheidsintervallen (robuustheidscontrole)
- Merkmigratie-analyse (stabiliteit over tijd)
Alle acht methoden komen uit op dezelfde conclusie: genderbias is systematisch, platformafhankelijk en contextafhankelijk.
Wat er veranderde tussen studies: patronen in merkmigratie
Sommige merken behielden een consistente gendercategorisatie over alle drie de studies. Andere verschoven:
Stabiele genderkoppelingen:
- Aan mannen gekoppeld in alle studies: Garmin, DeWalt, Milwaukee, Rolex, Omega
- Aan vrouwen gekoppeld in alle studies: Stanley, KitchenAid, Glossier
Verschoven categorisatie:
- Theragun: aan mannen gekoppeld (studie 1) → neutraal (studie 3)
- Peloton: aan mannen gekoppeld (studie 1) → neutraal (studie 3)
- Kindle: 100% aan vrouwen gekoppeld (studie 1) → seizoensafhankelijk (studie 3, nog steeds 13 à 17pp kloof)
- Oura: aan vrouwen gekoppeld (studie 1) → neutraal (studie 3)
Alleen seizoensgebonden verschijning:
- Tiffany, Cartier: onzichtbaar in de kerststudies, aan vrouwen gekoppeld in de Valentijnsstudie
- Ray-Ban, LG: alleen bij tijdgebonden vragen, nooit met genderframing
Belangrijkste inzicht: De gendercategorisatie van AI ontwikkelt zich. Een merk dat vorig kwartaal aan gender was gekoppeld, kan verschoven zijn. Regelmatig testen is de enige manier om je actuele status te kennen.
Waarom "partner" en "kind" niet genderneutraal zijn
We testten genderneutrale taal in alle drie de studies. De resultaten bewijzen dat neutraliteit een illusie is.
Studie 1: "partner" = patroon van de echtgenote
- Vragen over de partner delen 69,2% van de merken met vragen over de echtgenote
- Vragen over de partner delen 37,5% van de merken met vragen over de echtgenoot
- Partner is niet neutraal. Het valt standaard terug op vrouwelijke framing.
Studie 2: "kind" = patroon van de dochter
- Vragen over een kind delen 56,2% van de merken met vragen over een dochter
- Vragen over een kind delen 42,6% van de merken met vragen over een zoon
- Kind is niet neutraal. Het valt standaard terug op vrouwelijke framing.
Studie 3: "partner" = patroon van de echtgenote (opnieuw)
- Vragen over de partner delen 64,8% van de merken met vragen over de echtgenote
- Vragen over de partner delen 41,3% van de merken met vragen over de echtgenoot
- Het patroon houdt stand over seizoenscontexten heen.
Als je merkstrategie leunt op "inclusieve" of "genderneutrale" positionering, optimaliseer je mogelijk voor vrouwelijk geframede zichtbaarheid terwijl je mannelijk geframede aanbevelingen volledig misloopt. AI interpreteert neutraliteit standaard als vrouwelijk.
De afhankelijkheid van de seizoenscontext: Kerstmis versus Valentijnsdag
Dit is de bevinding die fundamenteel verandert hoe we AI-bias begrijpen.
Geteste hypothese: Levert dezelfde genderframing een consistent vooroordeel op over verschillende seizoenscontexten?
Antwoord: Nee. De richting van het vooroordeel keert om.
| Metriek | Kerstmis (studies 1&2) | Valentijnsdag (studie 3) | Verandering |
|---|---|---|---|
| Kloof echtgenote vs echtgenoot Gemini | -41% merken | +8,8% merken | 49,8pp omkering |
| Aan vrouwen gekoppelde merken | 17 merken | 12 merken (maar andere set) | -29% |
| Aan mannen gekoppelde merken | 48 merken | 22 merken (maar andere set) | -54% |
| Genderneutrale PASOR-balans | Vrouwelijk vertekend | Evenwichtiger | Verbeterd |
Waarom dit gebeurt: De trainingsdata van AI coderen culturele patronen. Cadeaus geven met Kerstmis is in de westerse cultuur traditioneel mannelijk geframed (echtgenoten kopen cadeaus voor echtgenotes, vaders kopen voor kinderen). Valentijnsdag is vrouwelijk geframed (vriendjes kopen voor vriendinnen, echtgenoten voor echtgenotes).
AI past geen universeel gendervooroordeel toe. AI past contextspecifieke, aangeleerde patronen uit de trainingsdata toe.
Dit verklaart waarom metingen op één moment misleidend zijn. Een merk dat de kerstaanbevelingen domineert, kan tijdens Valentijnsdag onzichtbaar zijn, of andersom. Seizoensgebonden testen is verplicht voor een volledige beoordeling van je zichtbaarheid.
Wat dit betekent voor je merk
Als je in een "mannelijk gecodeerde" categorie zit
Voorbeelden: gereedschap, techgadgets, outdoorspullen, sportuitrusting, luxehorloges
Jouw realiteit:
- Sterke zichtbaarheid bij vragen over echtgenoot/zoon/vriend
- Zwakke of nulzichtbaarheid bij vragen over echtgenote/dochter/vriendin tijdens Kerstmis
- Mogelijk betere zichtbaarheid bij vrouwelijk geframede vragen tijdens Valentijnsdag (platformafhankelijk)
Jouw risico:
- Je mist 40 tot 50% van de potentiële markt tijdens drukke cadeauseizoenen
- Contentoptimalisatie lost dit niet op; het vooroordeel zit in het categoriemodel van AI
Jouw strategie:
- Test PASOR over alle genderframings voor elke seizoenscontext
- Bepaal welke seizoenscontexten jouw categorie bevoordelen
- Plan grote campagnes rond gunstige seizoensvensters
- Overweeg of je categorietoewijzing klopt (dien een beroep in bij AI-teams als dat niet zo is)
Als je in een "vrouwelijk gecodeerde" categorie zit
Voorbeelden: sieraden, huishoudelijke artikelen, beauty, wellness, keukenapparatuur
Jouw realiteit:
- Sterke zichtbaarheid bij vragen over echtgenote/dochter/vriendin tijdens Kerstmis
- Mogelijk minder voordeel tijdens Valentijnsdag (seizoensomkering)
- Zwakke of nulzichtbaarheid bij vragen over echtgenoot/zoon/vriend
Jouw risico:
- Je laat 40 tot 50% van de markt over aan concurrenten die het categorieprobleem hebben opgelost
- Je bent onzichtbaar voor mannelijke cadeaugevers die je product voor zichzelf willen kopen
Jouw strategie:
- Test of je product echt genderspecifiek is of alleen naar gender gecategoriseerd
- Bouw content die categorieën overbrugt als het product neutraal is maar aan een categorie gekoppeld
- Volg seizoensverschuivingen; je Valentijnsvoordeel houdt mogelijk niet het hele jaar stand
Als je platformspecifiek bent
Voorbeelden: Ray-Ban, Samsung, Google (alleen tijdgebonden verschijning), Tiffany (alleen Valentijn)
Jouw realiteit:
- Onzichtbaar bij standaard genderframede vragen
- Je verschijnt alleen in tijdgebonden of seizoensspecifieke contexten
- Je bent mogelijk uitgesloten van de trainingsdata van LLM's of valt onder de aanbevelingsdrempels
Jouw strategie:
- Onderzoek waarom je afwezig bent bij standaardaanbevelingen
- Vergroot merkvermeldingen in contexten die AI gebruikt voor training
- Test of andere vraagstructuren zichtbaarheid ontsluiten
Als je een evenwichtige PASOR bereikt (zoals Apple)
Evenwichtige merken: Apple, Sony, Bose, LEGO, Patagonia, Nintendo
Jouw realiteit:
- Je verschijnt consequent over genderframings heen (±10 tot 15% variatie)
- Je behoudt zichtbaarheid over seizoenscontexten heen
- Je bent niet gekoppeld aan een specifieke doelgroepcategorie
Jouw voordeel:
- Maximaal aanbevelingsbereik over alle vraagtypes heen
- Lager risico op seizoensschommelingen
- Beter beschermd tegen categoriepoortwachten
Jouw strategie:
- Behoud een evenwichtige positionering over alle content heen
- Let op categoriedrift die je in één doelgroep kan opsluiten
- Gebruik je evenwichtige status als concurrentievoordeel
De academische validatie: peer review doet ertoe
Dit onderzoek is ingediend bij het tijdschrift Human-Centric Intelligent Systems van Springer, een peer-reviewed academische publicatie op het gebied van AI en mens-computerinteractie.
Waarom dit ertoe doet:
-
Onafhankelijke beoordeling: Drie anonieme experts in onderzoek naar AI-bias valideren de methodologie, statistische striktheid en conclusies voor publicatie.
-
Reproduceerbaarheid: De volledige methodologie, statistische toetsen en effectgroottes zijn gedocumenteerd. Andere onderzoekers kunnen de bevindingen repliceren.
-
Blijvende citatie: Zodra het is gepubliceerd, wordt dit onderzoek onderdeel van de blijvende academische verslaglegging over AI-bias, geciteerd door toekomstige studies.
-
Geloofwaardigheid in de sector: Academische validatie weegt zwaar bij zakelijke kopers, toezichthouders en media.
Het ingediende pakket bevat:
- Het volledige artikel (30 pagina's, 1.279 waarnemingen geanalyseerd)
- Een statistische bijlage met alle acht validatietoetsen
- Een verklaring over de beschikbaarheid van de ruwe data
- Een verklaring over belangenverstrengeling (onderzoek gefinancierd door Rankfor.AI, auteur is de oprichter)
Huidige status: In beoordeling (ingediend februari 2026). Verwachte beslissing: april-mei 2026.
Als je dit onderzoek presenteert aan directies, toezichthouders of journalisten, kun je het aanhalen als "in peer review bij Springer Human-Centric Intelligent Systems". Zodra het is aanvaard, wordt het citeerbare academische literatuur.
De implicaties voor onderzoek naar AI-eerlijkheid
Dit onderzoek draagt op drie manieren bij aan de bredere literatuur over AI-eerlijkheid:
1. Contextafhankelijke modulatie van vooroordeel
Eerder werk over AI-bias gaat ervan uit dat vooroordeel statisch is; als een model bevooroordeeld is, past het dat vooroordeel consistent toe. Onze bevindingen bewijzen dat dit onjuist is voor LLM-aanbevelingen.
Belangrijkste bijdrage: Genderbias in commerciële AI is geen vaste parameter. Het wordt gemoduleerd door seizoenscontext, type ontvanger en relatieframing. Eerlijkheidsaudits die slechts één context testen, missen omkeringen in andere contexten.
2. Uitdagingen van leren in een open wereld
LLM's opereren in open-wereldomgevingen waar gebruikersvragen ongebonden demografische en seizoenscontexten bestrijken. Traditionele detectie van vooroordeel in een gesloten wereld (testen op vaste datasets) kan deze complexiteit niet vatten.
Belangrijkste bijdrage: We tonen aan dat LLM-bias zich anders manifesteert over seizoenscontexten die in de trainingsdata waarschijnlijk ondervertegenwoordigd waren. Dit sluit aan bij onderzoek naar leren in een open wereld over hoe modellen generaliseren buiten hun trainingsverdeling.
3. Categoriepoortwachten als mechanisme van vooroordeel
De meeste onderzoeken naar vooroordelen richten zich op stereotype concentratie (herhaaldelijk dezelfde paar opties aanbevelen). Wij identificeren een ander mechanisme.
Belangrijkste bijdrage: AI stereotypeert vrouwelijk gerichte vragen niet met beperkte merksets. Het sluit hele productcategorieën uit van overweging en verdeelt de aanbevelingen vervolgens gelijkmatig binnen de toegestane categorieën. Dit "categoriepoortwachten" is moeilijker te detecteren omdat diversiteitsmetrieken (Shannon-entropie, Gini-coëfficiënt) normaal lijken.
Wat je nu moet doen
1. Voer een PASOR-audit over meerdere seizoenen uit
Test je merk over:
- Alle genderframings (echtgenoot/echtgenote/vriend/vriendin/partner)
- Alle seizoenscontexten (Kerstmis, Valentijnsdag, Moederdag/Vaderdag, verjaardagen)
- Alle drie de grote platforms (Gemini, GPT, Grok)
Meet de PASOR voor elke combinatie. Bepaal waar je zichtbaar bent, waar je buitengesloten bent en of je met seizoensomkeringen te maken hebt.
2. Controleer je categorietoewijzing
Als je aan gender gekoppeld bent maar je product echt genderneutraal is, onderzoek dan:
- Met welke productcategorieën associeert AI je merk?
- Zijn die categorieën in AI-antwoorden gecodeerd als mannelijk of vrouwelijk?
- Kun je categorieën overbruggen met content die demografische grenzen doorkruist?
3. Houd merkmigratie in de gaten
Ons onderzoek bewijst dat gendercategorisatie niet statisch is. Merken verschuiven tussen studies. Zet kwartaaltesten op om te detecteren wanneer je status verandert.
4. Segmenteer je zichtbaarheidsmetrieken
De totale PASOR verbergt genderkloven. Rapporteer altijd:
- Mannelijk geframede PASOR (echtgenoot/zoon/vriend)
- Vrouwelijk geframede PASOR (echtgenote/dochter/vriendin)
- Neutraal geframede PASOR (partner/kind)
- De kloof tussen mannelijk en vrouwelijk (die doet er meer toe dan het gemiddelde)
5. Pas je strategie aan per seizoen
Als je seizoensomkeringen ontdekt (zoals de verschuiving van Kerstmis naar Valentijn), plan dan je campagnes daarop:
- Zet vrouwelijk gerichte boodschappen in tijdens seizoenen waarin vrouwelijk geframede vragen meer merken krijgen
- Zet mannelijk gerichte boodschappen in tijdens seizoenen waarin mannelijk geframede vragen domineren
- Test opkomende seizoenscontexten (Prime Day, Black Friday, terug naar school)
Controleer of je merk aan gender is gekoppeld
We bouwden een gratis tool die je merk door dezelfde analyse haalt die we in dit onderzoek gebruikten.
Wat je te zien krijgt:
- PASOR-scores over alle genderframings
- Welke seizoenscontexten je merk bevoordelen
- Hoe je zichtbaarheid zich verhoudt over Gemini, GPT en Grok
- Of je aan een categorie bent gekoppeld zoals Kindle of evenwichtig bent zoals Apple
Drie prompts. Drie platforms. Drie seizoenscontexten. Directe PASOR-analyse.
Geen e-mail vereist. Duurt 90 seconden.
Controleer de genderkoppelingsstatus van je merk
Samenvatting van de methodologie
- Totaal aantal zoekopdrachten: 1.279 (299 + 480 + 500 over drie studies)
- Geteste platforms: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
- Prompts per studie:
- Studie 1: 4 condities (echtgenoot/echtgenote/partner/2025)
- Studie 2: 4 condities (zoon/dochter/kind/2026)
- Studie 3: 5 condities (echtgenoot/echtgenote/vriend/vriendin/partner)
- Temperatuur: 0,7 (studies 2-3), standaard (studie 1)
- Gegevensverzameling: december 2025 tot februari 2026
- Statistische validatie: chi-kwadraattoetsen, Cohen's d, Cramér's V, Shannon-entropie, Gini-coëfficiënt, Jaccard-index, bootstrap-betrouwbaarheidsintervallen
- Effectgroottes: middelgroot tot groot (Cramér's V = 0,23 tot 0,38, Cohen's d = 0,82 tot 1,24)
- Peer review: ingediend bij Springer Human-Centric Intelligent Systems, februari 2026
De volledige statistische bijlage en ruwe data zijn op verzoek beschikbaar. Neem contact op via research@rankfor.ai voor vragen over academische samenwerking.
Gerelateerd onderzoek
Kindle: 100% van de vragen over de echtgenote. 0% van de vragen over de echtgenoot. Dezelfde AI.
Onze oorspronkelijke ontdekking (december 2025, n=299) die als eerste het Kindle-fenomeen identificeerde en de statistische basis legde voor genderbias in LLM-aanbevelingen. Dit onderzoek werd studie 1 in de analyse met drie studies.
Belangrijkste bevinding: 41% minder merken bij vragen over de echtgenote. Chi-kwadraat 137,32, p<0,001.
Slechts 2 merken zijn zichtbaar op alle AI-platforms. Is het jouwe er één?
De studie met kinderen als ontvanger (januari 2026, n=480) die bewees dat genderbias verder reikt dan volwassen contexten en die aantoonde dat universele zichtbaarheid vrijwel onmogelijk te bereiken is. Dit onderzoek werd studie 2 in de analyse met drie studies.
Belangrijkste bevinding: Alleen LEGO en Disney bereiken universele platformoverstijgende zichtbaarheid. 28% minder merken bij vragen over een dochter.
Onderzoek uitgevoerd door Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Ingediend bij Springer Human-Centric Intelligent Systems, februari 2026. Volledig artikel, statistische bijlage en ruwe data op verzoek beschikbaar.
Kernbegrippen
PASOR (Prompt-Adjusted Share of Recommendation): Het percentage relevante zoekopdrachten waarbij je merk verschijnt in AI-antwoorden. Anders dan traditionele rankings meet PASOR opname versus uitsluiting, geen positie.
Categoriepoortwachten: Wanneer AI hele productcategorieën uitsluit van genderspecifieke vragen in plaats van te stereotyperen binnen een toegestane set. Via Shannon-entropieanalyse geïdentificeerd als het primaire mechanisme van vooroordeel.
Aan gender gekoppeld merk: Een merk dat uitsluitend in één genderframing verschijnt (bijvoorbeeld alleen bij vragen over de echtgenoot) en nooit in andere. Ons onderzoek identificeerde 69 zulke merken over drie studies.
Seizoensgebonden omkering van vooroordeel: Wanneer de richting van de genderbias verandert op basis van de seizoenscontext. Kerstmis vermindert vrouwelijk geframede aanbevelingen met 28 tot 61%, terwijl Valentijnsdag ze met 8,8% verhoogt (Gemini).
Overeenstemming tussen modellen (Jaccard-index): Het percentage merken dat door meerdere AI-platforms wordt aanbevolen voor dezelfde vraag. Lage overeenstemming (10 tot 45% in onze studies) wijst op platformafhankelijke zichtbaarheid.
Cramér's V: Een maat voor de sterkte van de associatie bij chi-kwadraattoetsen, met een bereik van 0 (geen associatie) tot 1 (perfecte associatie). Waarden van 0,23 tot 0,38 wijzen op middelgrote tot grote associaties tussen gender en categorie in onze studies.
Cohen's d: Een gestandaardiseerde maat voor het verschil tussen twee groepen. Waarden van 0,82 tot 1,24 wijzen op grote praktische verschillen in merkaantallen tussen genderframings.
Merkmigratie: Wanneer de gendercategorisatie van een merk verandert tussen meetperiodes. Theragun, Peloton en Oura verschoven allemaal van aan gender gekoppeld naar neutraal tussen studies.
