Tegime 1,279 päringut kolme tehisintellekti platvormi ja kahe kinkehooaja lõikes. Tulemus: statistiliselt kindel tõestus, et tehisintellekt kohtleb brände soo põhjal erinevalt, ning et kallutatuse suund muutub sõltuvalt sellest, kas küsite jõulude või sõbrapäeva ajal.
Avastus, mis lõpetas vaidluse
Aasta jooksul oleme dokumenteerinud soolist kallutatust tehisintellekti brändisoovitustes. Kõigepealt leidsime Kindle'i fenomeni: 100% nähtavus naise-päringutes, 0% mehe-päringutes. Seejärel laiendasime uuringut lastele kingisaajatena ja leidsime, et kallutatus püsis: tütardele 28% vähem brände kui poegadele.
Mõned väitsid, et need on üksikjuhtumid. Platvormide veidrused. Juhuslik hajuvus. Statistiline müra.
See uuring lõpetab selle vaidluse.
1,279 päringut. Kolm teineteist täiendavat uuringut. Kaks hooajalist konteksti. Üks järeldus: sooline kallutatus tehisintellekti soovitustes on süstemaatiline, statistiliselt tõestatud ja kontekstist sõltuv.
Artikkel, mis on esitatud ajakirjale Springer's Human-Centric Intelligent Systems, annab formaalse akadeemilise kinnituse sellele, mida esmalt täheldasime reaalsetes testides. Statistilised tõendid ei ole enam vaidlustatavad.
Kolme uuringu ülesehitus: miks see uuring on veenev
Enamik kallutatuse uuringuid testib üht stsenaariumi ja loeb töö tehtuks. Meie kavandasime kolm omavahel seotud uuringut, et välistada iga alternatiivne selgitus:
Uuring 1: jõulukingid täiskasvanutele (detsember 2025, n=299)
Testitud päringud: husband/wife/partner/2025 gift Peamine leid: Gemini annab naise-päringutele 41% vähem brände Statistiline tõestus: χ² = 137.32, p < 0.001
Uuring 2: jõulukingid lastele (jaanuar 2026, n=480)
Testitud päringud: son/daughter/child/2026 gift Peamine leid: kõigis platvormides 28% vähem brände tütre-päringutele Statistiline tõestus: χ² = 524.32, p < 0.001 (peaaegu 4 korda tugevam kui uuringus 1)
Uuring 3: sõbrapäeva kingid partneritele (veebruar 2026, n=500)
Testitud päringud: husband/wife/boyfriend/girlfriend/partner Peamine leid: hooajaline PÖÖRE, naise raamistusega päringud saavad Geminis 8.8% ROHKEM brände Statistiline tõestus: χ² = 89.45, p < 0.001
Koondanalüüs: 1,279 sõltumatut vaatlust 12 päringutingimuse ja 3 tehisintellekti platvormi lõikes.
Kolm uuringut: valimi suurus ja soopõhine erinevus uuringute kaupa
Statistiline kinnitus on ülekaalukas. Craméri V väärtused 0.23-0.38 näitavad keskmisi kuni suuri efekti suurusi. Bootstrap-usaldusvahemikud kinnitavad, et efektid on tugevad. See ei ole juhuslik hajuvus. See on süstemaatiline kallutatus.
Pööre, mis muutis kõike
Siin on leid, mis muudab arusaama tehisintellekti kallutatusest:
Jõuluraamistus: tehisintellekt soovitab naistele suunatud päringutele 28-61% vähem brände Sõbrapäeva raamistus: tehisintellekt soovitab Geminis naistele suunatud päringutele 8.8% ROHKEM brände
Sama tehisintellekt. Sama brändide hulk. Erinev hooaeg. Vastupidine kallutatuse suund.
| Platvorm | Jõulude naise-erinevus | Sõbrapäeva naise-erinevus | Hooajaline muutus |
|---|---|---|---|
| Gemini | -41% brändi | +8.8% brändi | 49.8% pööre |
| GPT | -15% brändi | +12.1% brändi | 27.1% pööre |
| Grok | -35% brändi | -2.3% brändi | 32.7% pööre |
Hooajaline kallutatuse pööre: jõulud vs sõbrapäev
See avastus tõestab kolme olulist punkti:
- Kallutatus sõltub kontekstist. Sama päringustruktuur annab eri hooajalistes kontekstides vastupidiseid tulemusi.
- Tehisintellekt on õppinud kultuurimustreid. Sõbrapäev on treeningandmetes kodeeritud naisele suunatuna, mis pöörab ümber vaikimisi mehele kallutatuse.
- Ühekordsed mõõtmised on mõttetud. Teie bränd võib ühes hooajalises kontekstis domineerida ja teises olla nähtamatu.
Akadeemiline termin selle kohta on „kontekstist sõltuv kallutatuse moduleerimine". Praktiline termin on: teie tehisintellekti nähtavuse strateegia peab arvestama hooajalisusega, muidu mõõdate poolt pildist.
69 sooliselt lukustatud brändi: täielik nimekiri
Kõigi kolme uuringu peale tuvastasime 69 brändi, mis ilmuvad ainult ühes sooraamistuses:
Mehele lukustatud brändid (kokku 48):
- Tehnika/vidinad: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
- Tööriistad: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
- Õuetegevused: Traeger, Weber, Osprey, North Face, Patagonia (osaliselt)
- Hooldus: Dollar Shave Club, Manscaped
- Kellad: Rolex, Omega, Seiko, Tissot
- Sport: Titleist, Under Armour, Theragun (ainult jõulud)
Naisele lukustatud brändid (kokku 17):
- Kodu: Stanley, KitchenAid, Vitamix, Breville, Our Place
- Ilu: Glossier, Kate Spade
- Heaolu: Oura (ainult jõulud), Peloton (ainult jõulud)
- Lugemine: Kindle (jõuludel domineeriv, sõbrapäeval neutraalne)
- Ehted: Tiffany (ainult sõbrapäev)
Platvormispetsiifilised lukud (4 brändi):
- Ray-Ban, LG, Google, Samsung ilmuvad ainult ajalistes/neutraalsetes päringutes
Uuringu märkus: Mõned brändid liikusid uuringute vahel. Theragun oli uuringus 1 mehele lukustatud, kuid uuringus 3 neutraalne. Kindle liikus 100% naisele lukustatust hooajast sõltuvaks. Tehisintellekti sooline kategoriseerimine ei ole staatiline.
Kui teie bränd on selles nimekirjas, olete pool oma potentsiaalsest turust nähtamatu sõltuvalt sellest, kuidas küsimus on raamitud. Ükski sisu optimeerimine seda ei paranda; kallutatus asub tehisintellekti kategooriamudelis, mitte teie sõnumis.
Mehhanism: kategooriapõhine väravavahtimine
Testisime kahte konkureerivat hüpoteesi selle kohta, kuidas tehisintellekt soolist kallutatust tekitab:
Hüpotees 1: stereotüüpne koondumine Tehisintellekt soovitab naise-päringutele korduvalt samu üksikuid stereotüüpseid brände (madal mitmekesisus).
Hüpotees 2: kategooriapõhine väravavahtimine Tehisintellekt välistab naise-päringutest terved tootekategooriad, kuid jaotab soovitused lubatud kategooriate sees ühtlaselt (kõrge mitmekesisus, kuid väiksem valik).
Shannoni entroopia analüüs tõestas, et hüpotees 2 on õige.
Naistele suunatud päringute Shannoni entroopia on 0.86-0.88 (peaaegu identne mehe-päringutega). Gini koefitsiendid on naise-päringutel tegelikult MADALAMAD (0.30-0.48) kui mehe-päringutel (0.41-0.57), mis tähendab ühtlasemat jaotust soovitatud brändide vahel.
Tehisintellekt ei ole stereotüüpne. Tehisintellekt on välistav.
Kategooriapõhine väravavahtimine tähendab, et tehisintellekt otsustab, millised tootekategooriad on igale soole „sobivad", ja välistab seejärel terved brändikogumid kaalumisest. Bränd „mehele kodeeritud" kategoorias ei satu naise-päringute soovitusvalikusse üldse.
See on halvem kui stereotüpiseerimine. Stereotüpiseerimine hoiaks teie brändi vähemalt nähtavana (kuigi valesti positsioneerituna). Väravavahtimine muudab teie brändi tervete päringumustrite jaoks nähtamatuks.
Kuidas väravavahtimine praktikas toimib
Kui keegi küsib „Mis on parim kingitus mu naisele?", ei otsi tehisintellekt läbi kõiki brände ega vali stereotüüpseid. Selle asemel:
- Tehisintellekt tuvastab „naisele sobivad" tootekategooriad: ehted, kodukaubad, heaolu, ilu, lugemine
- Tehisintellekt otsib brändisoovitusi AINULT nendest kategooriatest
- „Mehele kodeeritud" kategooriate brändid (tööriistad, tehnikavidinad, õuevarustus, kellad) jäetakse kaalumisest välja
- Soovitused jaotatakse lubatud kategooriate vahel ühtlaselt
Sama protsess toimub vastupidiselt mehe-päringute puhul, ainult suurema lubatud kategooriate hulgaga (sellest ka suuremad brändide arvud).
Just seepärast ilmub Kindle naise-päringutele ja mitte mehe-päringutele. Amazoni e-luger kuulub „lugemise/kodu" kategooriaklastrisse, mille tehisintellekt on kodeerinud naisele sobivaks. Toode on sooneutraalne. Kategooriamäärang ei ole.
Mudelitevaheline kokkulangevus: endiselt kohutav
Vaatamata 1,279 päringu analüüsimisele ei suuda tehisintellekti platvormid ikka kokku leppida, milliseid brände soovitada:
| Uuring | Gemini-GPT kattuvus | Gemini-Grok kattuvus | GPT-Grok kattuvus |
|---|---|---|---|
| Uuring 1 (jõulud, täiskasvanud) | 14% (Jaccard 0.08) | 45% (Jaccard 0.38) | 28% (Jaccard 0.17) |
| Uuring 2 (jõulud, lapsed) | 10% (Jaccard 0.10) | 42% (Jaccard 0.35) | 25% (Jaccard 0.20) |
| Uuring 3 (sõbrapäev) | 18% (Jaccard 0.12) | 51% (Jaccard 0.45) | 33% (Jaccard 0.25) |
Mudelitevaheline kokkulangevus (Jaccardi indeks) uuringute lõikes
Keskmine mudelitevaheline kokkulangevus: 20-35%.
Tõlge: kui mõõdate oma tehisintellekti nähtavust ainult ühes platvormis, näete 20-35% tegelikkusest. Ülejäänud 65-80% brändisoovitustest on konkureerivatel platvormidel täiesti erinevad.
Platvormide iseloomud jäävad püsivaks
Kolm platvormi säilitavad kõigis uuringutes selged „iseloomud":
GPT-5.2: brändiminimalist
- Keskmiselt 0.1-4.7 brändi vastuse kohta (madalaim kõigis uuringutes)
- Soovitab sageli null konkreetset brändi, eelistades kategooriaid („kaalu nutikella")
- Tahtlik brändidest hoidumine on strateegiline valik, mitte võimekuse piirang
Gemini: brändimaksimalist
- Keskmiselt 3.7-11.9 brändi vastuse kohta (kõrgeim kõigis uuringutes)
- Nimetab järjepidevalt 4-12 konkreetset brändi vastuse kohta
- Kõige tundlikum soolise kallutatuse suhtes (suurimad erinevused mehe- ja naise-päringute vahel)
Grok: tõhus kesktee
- Keskmiselt 2.5-10.0 brändi vastuse kohta
- Suurim brändide tihedus tähemärgi kohta (kõige tootekesksem)
- Kõige stabiilsem sooraamistuste lõikes (väikseimad erinevused)
Kui optimeerite tehisintellekti nähtavust ilma kõiki kolme platvormi testimata, optimeerite ühe iseloomu jaoks, jättes kaks teist tähelepanuta.
PASOR-mõõdik: mõõdame seda, mis tegelikult loeb
Traditsioonilised mõõdikud nagu „näitamised" või „edetabelikohad" ei kehti tehisintellekti soovituste puhul. Kas olete vastuses või olete nähtamatu. Pole 1. positsiooni ega 10. positsiooni.
Tutvustame Prompt-Adjusted Share of Recommendation (PASOR) mõõdikut:
PASOR = (Your brand's appearance count / Total relevant queries) × 100
Näide: Kindle uuringus 1 (jõulud, täiskasvanud)
- Naise-päringud: 100% PASOR (39 ilmumist / 39 naise-päringut)
- Partneri-päringud: 100% PASOR (30 ilmumist / 30 partneri-päringut)
- Mehe-päringud: 0% PASOR (0 ilmumist / 40 mehe-päringut)
- Üldine PASOR: 63.4% (69 ilmumist / 109 päringut kokku)
Kuid siin on probleem: üldine PASOR varjab soolisi erinevusi. Kui mõõdate ainult koondtulemust, jääb märkamata, et domineerite ühes demograafilises rühmas ja olete teises nähtamatu.
Soo järgi segmenteeritud PASOR paljastab tõe:
- Mehe raamistusega PASOR: 0%
- Naise raamistusega PASOR: 100%
- Erinevus: 100 protsendipunkti
Tasakaalustatud nähtavust otsivate brändide jaoks loeb erinevus rohkem kui keskmine.
PASOR praktikas: sõbrapäeva pööre
Uuringu 3 PASOR valitud brändide kohta:
| Bränd | Mehe PASOR | Naise PASOR | Poiss-sõbra PASOR | Tüdruk-sõbra PASOR | Erinevus |
|---|---|---|---|---|---|
| Tiffany | 0% | 73% | 0% | 80% | -73pp |
| Apple | 67% | 60% | 70% | 57% | +7pp (tasakaalus) |
| LEGO | 33% | 20% | 37% | 23% | +13pp |
| Kindle | 27% | 40% | 23% | 43% | -13pp (sõbrapäeval neutraalne vs jõuludel äärmuslik) |
Apple saavutab peaaegu universaalse PASOR-i (57-70% kõigis raamistustes). Tiffany on täielikult sooliselt lukustatud naise-päringutele. Kindle'i sooline erinevus kahanes uuringu 1 100 protsendipunktilt uuringu 3 13-17 punktini, tõestades, et kategooriamäärangud võivad hooajaliselt muutuda.
Statistilised tõendid: väljaspool kahtlust
Lugejatele, kes kahtlevad, kas need efektid on tõelised või lihtsalt mõõtemüra, siin on formaalne statistiline kinnitus:
Hii-ruut testid (kategooria ja soo sõltumatus)
| Uuring | χ² väärtus | p-väärtus | Craméri V | Efekti suurus | Tõlgendus |
|---|---|---|---|---|---|
| Uuring 1 | 137.32 | <0.001 | 0.23 | Keskmine | Lükkab sõltumatuse tagasi |
| Uuring 2 | 524.32 | <0.001 | 0.38 | Keskmine-suur | Lükkab sõltumatuse tagasi |
| Uuring 3 | 89.45 | <0.001 | 0.26 | Keskmine | Lükkab sõltumatuse tagasi |
Tõlge: Tõenäosus, et need mustrid on juhuslikud, on väiksem kui 0.1%. Tootekategooriad ja sooraamistus on süstemaatiliselt seotud.
Efekti suurused (brändide arvu erinevused)
| Võrdlus | Coheni d | 95% CI | Efekti suurus | Praktiline tähendus |
|---|---|---|---|---|
| Uuring 1: mees vs naine (Gemini) | 1.24 | [0.89, 1.59] | Suur | 41% vähem brände |
| Uuring 2: poeg vs tütar (kõik mudelid) | 0.82 | [0.61, 1.03] | Suur | 28% vähem brände |
| Uuring 3: sõbrapäeva naise PÖÖRE | -0.31 | [-0.58, -0.04] | Väike | 8.8% ROHKEM brände |
Efekti suurused on esitatud bootstrap-usaldusvahemikega (10,000 kordusvalimit). Kõik efektid on tugevad valimivariatsiooni suhtes.
Ristvalideerimine
Valideerisime leiud kaheksa sõltumatu statistilise testiga:
- Hii-ruut testid (kategooria ja soo seos)
- Coheni d (brändide arvu erinevused)
- Shannoni entroopia (mitmekesisus soorühmade sees)
- Gini koefitsient (koondumine/ebavõrdsus)
- Jaccardi indeks (mudelitevaheline kattuvus)
- Craméri V (hii-ruut testi efekti suurus)
- Bootstrap-usaldusvahemikud (töökindluse kontroll)
- Brändide rände analüüs (ajaline stabiilsus)
Kõik kaheksa meetodit jõuavad samale järeldusele: sooline kallutatus on süstemaatiline, platvormist sõltuv ja kontekstist sõltuv.
Efekti suurus uuringute lõikes (Craméri V)
Mis muutus uuringute vahel: brändide rände mustrid
Mõned brändid säilitasid kõigi kolme uuringu jooksul järjepideva soolise kategoriseerimise. Teised liikusid:
Stabiilsed soolukud:
- Kõigis uuringutes mehele lukustatud: Garmin, DeWalt, Milwaukee, Rolex, Omega
- Kõigis uuringutes naisele lukustatud: Stanley, KitchenAid, Glossier
Muutunud kategoriseerimine:
- Theragun: mehele lukustatud (uuring 1) → neutraalne (uuring 3)
- Peloton: mehele lukustatud (uuring 1) → neutraalne (uuring 3)
- Kindle: 100% naisele lukustatud (uuring 1) → hooajast sõltuv (uuring 3, endiselt 13-17pp erinevus)
- Oura: naisele lukustatud (uuring 1) → neutraalne (uuring 3)
Ainult hooajaline ilmumine:
- Tiffany, Cartier: nähtamatud jõuluuuringutes, sõbrapäeva uuringus naisele lukustatud
- Ray-Ban, LG: ainult ajalised päringud, kunagi sooraamistuses
Peamine tähelepanek: Tehisintellekti sooline kategoriseerimine areneb. Bränd, mis oli eelmises kvartalis sooliselt lukustatud, võib olla muutunud. Regulaarne testimine on ainus viis oma praeguse seisu teadasaamiseks.
Miks „partner" ja „child" ei ole sooneutraalsed
Testisime sooneutraalset keelt kõigis kolmes uuringus. Tulemused tõestavad, et neutraalsus on illusioon.
Uuring 1: „partner" = naise muster
- Partneri-päringud jagavad 69.2% brändidest naise-päringutega
- Partneri-päringud jagavad 37.5% brändidest mehe-päringutega
- Partner ei ole neutraalne. See kaldub vaikimisi naise raamistusse.
Uuring 2: „child" = tütre muster
- Lapse-päringud jagavad 56.2% brändidest tütre-päringutega
- Lapse-päringud jagavad 42.6% brändidest poja-päringutega
- „Child" ei ole neutraalne. See kaldub vaikimisi naise raamistusse.
Uuring 3: „partner" = naise muster (taas)
- Partneri-päringud jagavad 64.8% brändidest naise-päringutega
- Partneri-päringud jagavad 41.3% brändidest mehe-päringutega
- Muster püsib hooajaliste kontekstide lõikes.
Kui teie brändistrateegia tugineb „kaasavale" või „sooneutraalsele" positsioneerimisele, võite optimeerida naise raamistusega nähtavuse jaoks ja jätta mehe raamistusega soovitused täielikult tähelepanuta. Tehisintellekt tõlgendab neutraalsust vaikimisi naiseks.
Hooajalise konteksti sõltuvus: jõulud vs sõbrapäev
See on leid, mis muudab põhjalikult arusaama tehisintellekti kallutatusest.
Testitud hüpotees: Kas sama sooraamistus tekitab eri hooajalistes kontekstides järjepideva kallutatuse?
Vastus: Ei. Kallutatuse suund pöördub.
| Mõõdik | Jõulud (uuringud 1&2) | Sõbrapäev (uuring 3) | Muutus |
|---|---|---|---|
| Gemini naise vs mehe erinevus | -41% brändi | +8.8% brändi | 49.8pp pööre |
| Naisele lukustatud brändid | 17 brändi | 12 brändi (kuid teine kogum) | -29% |
| Mehele lukustatud brändid | 48 brändi | 22 brändi (kuid teine kogum) | -54% |
| Sooneutraalne PASOR-tasakaal | Naisele kallutatud | Tasakaalustatum | Paranenud |
Miks see juhtub: Tehisintellekti treeningandmed kodeerivad kultuurimustreid. Jõulukinkimine on lääne kultuuris traditsiooniliselt mehe raamistuses (mehed ostavad kingitusi naistele, isad lastele). Sõbrapäev on naise raamistuses (poiss-sõbrad ostavad tüdruk-sõpradele, mehed naistele).
Tehisintellekt ei rakenda universaalset soolist kallutatust. Ta rakendab treeningandmetest õpitud kontekstispetsiifilisi mustreid.
See selgitab, miks ühekordsed mõõtmised on eksitavad. Bränd, mis domineerib jõulusoovitustes, võib sõbrapäeval olla nähtamatu, või vastupidi. Hooajaline testimine on täieliku nähtavuse hindamise jaoks kohustuslik.
Mida see teie brändi jaoks tähendab
Kui olete „mehele kodeeritud" kategoorias
Näited: tööriistad, tehnikavidinad, õuevarustus, spordivarustus, luksuskellad
Teie tegelikkus:
- Tugev nähtavus mehe/poja/poiss-sõbra päringutes
- Nõrk või olematu nähtavus naise/tütre/tüdruk-sõbra päringutes jõulude ajal
- Nähtavus võib sõbrapäeval naise raamistusega päringutes paraneda (platvormist sõltuv)
Teie risk:
- 40-50% potentsiaalse turu kaotamine suure mahuga kinkehooaegadel
- Sisu optimeerimine seda ei paranda; kallutatus on tehisintellekti kategooriamudelis
Teie strateegia:
- Testige PASOR-it kõigi sooraamistuste lõikes igas hooajalises kontekstis
- Tuvastage, millised hooajalised kontekstid soosivad teie kategooriat
- Ajastage suured kampaaniad soodsatele hooajalistele akendele
- Kaaluge, kas teie kategooriamäärang on täpne (kui ei, pöörduge tehisintellekti meeskondade poole)
Kui olete „naisele kodeeritud" kategoorias
Näited: ehted, kodukaubad, ilu, heaolu, köögitehnika
Teie tegelikkus:
- Tugev nähtavus naise/tütre/tüdruk-sõbra päringutes jõulude ajal
- Sõbrapäeval võib eelis väheneda (hooajaline pööre)
- Nõrk või olematu nähtavus mehe/poja/poiss-sõbra päringutes
Teie risk:
- 40-50% turu jätmine konkurentidele, kes lahendasid kategooriaprobleemi
- Nähtamatuks jäämine meestest kinkijatele, kes tahavad teie toodet endale osta
Teie strateegia:
- Testige, kas teie toode on tõeliselt soospetsiifiline või lihtsalt sooliselt kategoriseeritud
- Kui toode on neutraalne, kuid kategooriasse lukustatud, looge sisu, mis ühendab kategooriaid
- Jälgige hooajalisi nihkeid; teie sõbrapäeva eelis ei pruugi aasta ringi püsida
Kui olete platvormispetsiifiline
Näited: Ray-Ban, Samsung, Google (ainult ajaline ilmumine), Tiffany (ainult sõbrapäev)
Teie tegelikkus:
- Nähtamatu tavalistes sooraamistusega päringutes
- Ilmub ainult ajalistes või hooajaspetsiifilistes kontekstides
- Võib olla välja jäetud LLM-i treeningandmetest või jääda alla soovituslävendite
Teie strateegia:
- Uurige, miks te tavasoovitustest puudute
- Suurendage brändi mainimisi kontekstides, mida tehisintellekt treenimiseks kasutab
- Testige, kas erinevad päringustruktuurid avavad nähtavuse
Kui saavutate tasakaalustatud PASOR-i (nagu Apple)
Tasakaalustatud brändid: Apple, Sony, Bose, LEGO, Patagonia, Nintendo
Teie tegelikkus:
- Ilmub järjepidevalt sooraamistuste lõikes (±10-15% varieeruvus)
- Säilitab nähtavuse hooajaliste kontekstide lõikes
- Ei ole lukustatud ühtegi kindlasse demograafilisse kategooriasse
Teie eelis:
- Maksimaalne soovituste ulatus kõigi päringutüüpide lõikes
- Väiksem hooajalise kõikumise risk
- Paremini kaitstud kategooriapõhise väravavahtimise eest
Teie strateegia:
- Säilitage tasakaalustatud positsioneerimine kogu sisus
- Jälgige kategooriatriivi, mis võib teid ühte demograafilisse rühma lukustada
- Kasutage oma tasakaalustatud staatust konkurentsieelisena
Akadeemiline kinnitus: eelretsenseerimine loeb
See uuring on esitatud ajakirjale Springer's Human-Centric Intelligent Systems, mis on eelretsenseeritav akadeemiline väljaanne tehisintellekti ja inimese-arvuti interaktsiooni valdkonnas.
Miks see loeb:
-
Sõltumatu retsensioon: Kolm anonüümset tehisintellekti kallutatuse eksperti valideerivad enne avaldamist metoodika, statistilise rangeuse ja järeldused.
-
Korratavus: Kogu metoodika, statistilised testid ja efekti suurused on dokumenteeritud. Teised teadlased saavad leide korrata.
-
Viidete püsivus: Pärast avaldamist saab sellest uuringust osa tehisintellekti kallutatuse püsivast akadeemilisest arhiivist, millele tulevased uuringud viitavad.
-
Usaldusväärsus tööstuses: Akadeemilisel kinnitusel on kaalu suurte ostjate, regulaatorite ja meedia jaoks.
Esitatud pakett sisaldab:
- Täisartikkel (30 lehekülge, analüüsitud 1,279 vaatlust)
- Statistiline lisa kõigi kaheksa valideerimistestiga
- Toorandmete kättesaadavuse avaldus
- Huvide konflikti avaldus (uuringut rahastas Rankfor.AI, autor on asutaja)
Praegune seis: Retsenseerimisel (esitatud veebruaris 2026). Oodatav otsus: aprill-mai 2026.
Kui esitlete seda uuringut juhtidele, regulaatoritele või ajakirjanikele, saate viidata sellele kui „eelretsenseerimisel ajakirjas Springer Human-Centric Intelligent Systems". Pärast vastuvõtmist muutub see viidatavaks akadeemiliseks kirjanduseks.
Mõju tehisintellekti õigluse uurimisele
See uuring panustab laiemasse tehisintellekti õigluse kirjandusse kolmel viisil:
1. Kontekstist sõltuv kallutatuse moduleerimine
Varasem töö tehisintellekti kallutatuse teemal eeldab, et kallutatus on staatiline; kui mudel on kallutatud, rakendab ta seda kallutatust järjepidevalt. Meie leiud tõestavad, et LLM-i soovituste puhul on see vale.
Peamine panus: Sooline kallutatus kommertstehisintellektis ei ole fikseeritud parameeter. Seda moduleerivad hooajaline kontekst, saaja tüüp ja suhteraamistus. Õiglusauditid, mis testivad ainult üht konteksti, jätavad märkamata pöörded teistes kontekstides.
2. Avatud maailma õppimise väljakutsed
LLM-id töötavad avatud maailma keskkondades, kus kasutajapäringud katavad piiramatuid demograafilisi ja hooajalisi kontekste. Traditsiooniline suletud maailma kallutatuse tuvastamine (testimine fikseeritud andmestikel) ei suuda seda keerukust hõlmata.
Peamine panus: Näitame, et LLM-i kallutatus avaldub erinevalt hooajaliste kontekstide lõikes, mis olid treeningandmetes tõenäoliselt alaesindatud. See sobib kokku avatud maailma õppimise uuringutega selle kohta, kuidas mudelid üldistavad väljaspool treeningjaotusi.
3. Kategooriapõhine väravavahtimine kui kallutatuse mehhanism
Enamik kallutatuse uuringuid keskendub stereotüüpsele koondumisele (samade üksikute valikute korduv soovitamine). Meie tuvastame teistsuguse mehhanismi.
Peamine panus: Tehisintellekt ei stereotüpiseeri naistele suunatud päringuid kitsaste brändikogumitega. Ta välistab kaalumisest terved tootekategooriad ja jaotab seejärel soovitused lubatud kategooriate sees ühtlaselt. Seda „kategooriapõhist väravavahtimist" on raskem tuvastada, sest mitmekesisuse mõõdikud (Shannoni entroopia, Gini koefitsient) tunduvad normaalsed.
Mida peaksite nüüd tegema
1. Viige läbi mitmehooajaline PASOR-audit
Testige oma brändi järgmiste lõikes:
- Kõik sooraamistused (husband/wife/boyfriend/girlfriend/partner)
- Kõik hooajalised kontekstid (jõulud, sõbrapäev, ema-/isadepäev, sünnipäevad)
- Kõik kolm suuremat platvormi (Gemini, GPT, Grok)
Mõõtke PASOR-it iga kombinatsiooni kohta. Tuvastage, kus olete nähtav, kust olete välja lukustatud ja kas seisate silmitsi hooajaliste pööretega.
2. Kontrollige oma kategooriamäärangut
Kui olete sooliselt lukustatud, kuid teie toode on tõeliselt sooneutraalne, uurige:
- Milliste tootekategooriatega tehisintellekt teie brändi seostab?
- Kas need kategooriad on tehisintellekti vastustes kodeeritud mehele või naisele?
- Kas saate kategooriaid ühendada sisuga, mis ületab demograafilisi piire?
3. Jälgige brändide rännet
Meie uuring tõestab, et sooline kategoriseerimine ei ole staatiline. Brändid liiguvad uuringute vahel. Seadke üles kvartaalne testimine, et tuvastada, millal teie staatus muutub.
4. Segmenteerige oma nähtavuse mõõdikud
Üldine PASOR varjab soolisi erinevusi. Esitage alati:
- Mehe raamistusega PASOR (husband/son/boyfriend)
- Naise raamistusega PASOR (wife/daughter/girlfriend)
- Neutraalse raamistusega PASOR (partner/child)
- Erinevus mehe ja naise vahel (see loeb rohkem kui keskmine)
5. Kohandage strateegiat hooaja järgi
Kui avastate hooajalisi pöördeid (nagu jõuludelt sõbrapäevale nihe), ajastage oma kampaaniad vastavalt:
- Suunake naistele suunatud sõnumeid hooaegadel, mil naise raamistusega päringud saavad rohkem brände
- Suunake meestele suunatud sõnumeid hooaegadel, mil mehe raamistusega päringud domineerivad
- Testige uusi hooajalisi kontekste (Prime Day, Black Friday, kooliaasta algus)
Kontrollige, kas teie bränd on sooliselt lukustatud
Ehitasime tasuta tööriista, mis viib teie brändi läbi sama analüüsi, mida selles uuringus kasutasime.
Mida näete:
- PASOR-skoorid kõigi sooraamistuste lõikes
- Millised hooajalised kontekstid soosivad teie brändi
- Kuidas teie nähtavus võrdleb Gemini, GPT ja Groki lõikes
- Kas olete kategooriasse lukustatud nagu Kindle või tasakaalus nagu Apple
Kolm päringut. Kolm platvormi. Kolm hooajalist konteksti. Kohene PASOR-analüüs.
E-posti ei ole vaja. Võtab 90 sekundit.
Kontrollige oma brändi soolukustuse staatust
Metoodika kokkuvõte
- Päringute koguarv: 1,279 (299 + 480 + 500 kolme uuringu lõikes)
- Testitud platvormid: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
- Päringud uuringu kohta:
- Uuring 1: 4 tingimust (husband/wife/partner/2025)
- Uuring 2: 4 tingimust (son/daughter/child/2026)
- Uuring 3: 5 tingimust (husband/wife/boyfriend/girlfriend/partner)
- Temperatuur: 0.7 (uuringud 2-3), vaikeväärtus (uuring 1)
- Andmete kogumine: detsember 2025 kuni veebruar 2026
- Statistiline valideerimine: hii-ruut testid, Coheni d, Craméri V, Shannoni entroopia, Gini koefitsient, Jaccardi indeks, bootstrap-usaldusvahemikud
- Efekti suurused: keskmine kuni suur (Craméri V = 0.23-0.38, Coheni d = 0.82-1.24)
- Eelretsenseerimine: esitatud ajakirjale Springer Human-Centric Intelligent Systems, veebruar 2026
Täielik statistiline lisa ja toorandmed on nõudmisel kättesaadavad. Akadeemilise koostöö küsimustes võtke ühendust research@rankfor.ai.
Seotud uuringud
Kindle: 100% naise-päringutest. 0% mehe-päringutest. Sama tehisintellekt.
Meie algne avastus (detsember 2025, n=299), mis esimesena tuvastas Kindle'i fenomeni ja pani aluse soolise kallutatuse statistilisele vundamendile LLM-i soovitustes. Sellest uuringust sai kolme uuringu analüüsis uuring 1.
Peamine leid: naise-päringutele 41% vähem brände. Hii-ruut 137.32, p<0.001.
Ainult 2 brändi on nähtavad kõigis tehisintellekti platvormides. Kas teie oma on üks neist?
Laste kingisaajate uuring (jaanuar 2026, n=480), mis tõestas, et sooline kallutatus ulatub täiskasvanute kontekstidest kaugemale, ja tuvastas, et universaalne nähtavus on peaaegu võimatu saavutada. Sellest uuringust sai kolme uuringu analüüsis uuring 2.
Peamine leid: ainult LEGO ja Disney saavutavad universaalse platvormideülese nähtavuse. Tütre-päringutele 28% vähem brände.
Uuringu viis läbi Dmitrij Żatuchin, Eesti Ettevõtluskõrgkool Mainor (EUAS). Esitatud ajakirjale Springer Human-Centric Intelligent Systems, veebruar 2026. Täisartikkel, statistiline lisa ja toorandmed on nõudmisel kättesaadavad.
Põhimõisted
PASOR (Prompt-Adjusted Share of Recommendation): Nende asjakohaste päringute protsent, kus teie bränd tehisintellekti vastustes ilmub. Erinevalt traditsioonilistest edetabelitest mõõdab PASOR kaasamist versus välistamist, mitte positsiooni.
Kategooriapõhine väravavahtimine: Kui tehisintellekt välistab soospetsiifilistest päringutest terved tootekategooriad. See mehhanism erineb stereotüpiseerimisest, mille puhul brände soovitatakse lubatud kogumi seest. Tuvastati Shannoni entroopia analüüsi kaudu peamise kallutatuse mehhanismina.
Sooliselt lukustatud bränd: Bränd, mis ilmub ainult ühes sooraamistuses (nt ainult mehe-päringutes) ja mitte kunagi teistes. Meie uuring tuvastas kolme uuringu lõikes 69 sellist brändi.
Hooajaline kallutatuse pööre: Kui soolise kallutatuse suund muutub hooajalise konteksti põhjal. Jõulud vähendavad naise raamistusega soovitusi 28-61%, samas kui sõbrapäev suurendab neid 8.8% (Gemini).
Mudelitevaheline kokkulangevus (Jaccardi indeks): Nende brändide protsent, mida mitu tehisintellekti platvormi sama päringu jaoks soovitavad. Madal kokkulangevus (meie uuringutes 10-45%) viitab platvormist sõltuvale nähtavusele.
Craméri V: Hii-ruut testide seosetugevuse mõõt, mis ulatub 0-st (seos puudub) 1-ni (täiuslik seos). Väärtused 0.23-0.38 näitavad meie uuringutes keskmisi kuni suuri soo-kategooria seoseid.
Coheni d: Standardiseeritud mõõt kahe rühma erinevuse jaoks. Väärtused 0.82-1.24 näitavad suuri praktilisi erinevusi brändide arvus sooraamistuste vahel.
Brändi ränne: Kui brändi sooline kategoriseerimine muutub mõõtmisperioodide vahel. Theragun, Peloton ja Oura kõik liikusid uuringute vahel sooliselt lukustatust neutraalseks.
