OpenRankfor.AI
research

Gdy AI zmienia zdanie na temat płci: trzy badania dowodzą, że uprzedzenie jest realne, systematyczne i sezonowe

February 15, 2026
20 min read
n=929
Dmitrij Żatuchin
Gender BiasAI ResearchLLM RecommendationsSeasonal BiasCategory GatekeepingPASORGeminiGPT

Przeprowadziliśmy 1,279 zapytań na trzech platformach AI w dwóch sezonach prezentowych. Wynik: jednoznaczny dowód statystyczny, że AI traktuje marki różnie w zależności od płci, oraz że kierunek uprzedzenia zmienia się zależnie od tego, czy pytasz w okresie Świąt, czy Walentynek.


Odkrycie, które zakończyło dyskusję

Od roku dokumentujemy uprzedzenia płciowe w rekomendacjach marek generowanych przez AI. Najpierw odkryliśmy zjawisko Kindle: 100% widoczności dla zapytań o żonę, 0% dla zapytań o męża. Następnie rozszerzyliśmy badanie na dzieci jako odbiorców i uprzedzenie się utrzymało: o 28% mniej marek dla córek niż dla synów.

Niektórzy twierdzili, że to odosobnione przypadki. Kaprysy platform. Losowa zmienność. Szum statystyczny.

To badanie kończy tę dyskusję.

1,279 zapytań. Trzy uzupełniające się badania. Dwa konteksty sezonowe. Jeden wniosek: uprzedzenie płciowe w rekomendacjach AI jest systematyczne, udowodnione statystycznie i zależne od kontekstu.

Praca, złożona do czasopisma Human-Centric Intelligent Systems wydawnictwa Springer, stanowi formalne akademickie potwierdzenie tego, co najpierw zaobserwowaliśmy w testach na rzeczywistych danych. Dowody statystyczne nie pozostawiają już miejsca na dyskusję.


Projekt trzech badań: dlaczego te wyniki są rozstrzygające

Większość badań nad uprzedzeniami sprawdza jeden scenariusz i na tym poprzestaje. Zaprojektowaliśmy trzy powiązane badania, aby wykluczyć każde alternatywne wyjaśnienie:

Badanie 1: prezenty świąteczne dla dorosłych (grudzień 2025, n=299)

Testowane zapytania: mąż/żona/partner/prezent 2025 Kluczowy wynik: o 41% mniej marek dla zapytań o żonę na Gemini Dowód statystyczny: χ² = 137.32, p < 0.001

Badanie 2: prezenty świąteczne dla dzieci (styczeń 2026, n=480)

Testowane zapytania: syn/córka/dziecko/prezent 2026 Kluczowy wynik: o 28% mniej marek dla zapytań o córkę na wszystkich platformach Dowód statystyczny: χ² = 524.32, p < 0.001 (niemal 4-krotnie silniejszy niż w Badaniu 1)

Badanie 3: prezenty walentynkowe dla partnerów (luty 2026, n=500)

Testowane zapytania: mąż/żona/chłopak/dziewczyna/partner Kluczowy wynik: sezonowe ODWRÓCENIE, zapytania z żeńskim ramowaniem otrzymują o 8.8% WIĘCEJ marek na Gemini Dowód statystyczny: χ² = 89.45, p < 0.001

Analiza łączna: 1,279 niezależnych obserwacji w 12 warunkach zapytań i na 3 platformach AI.

Trzy badania: wielkość próby i luka płci w podziale na badanie

299480500-41-288.8Badanie 1: Święta, dorośliBadanie 2: Święta, dzieciBadanie 3: Walentynki0100200300400500
Wielkość próbyLuka marek dla kobiet (%)

Potwierdzenie statystyczne jest przytłaczające. Wartości V Craméra na poziomie 0.23-0.38 wskazują na średnią do dużej siłę efektu. Bootstrapowe przedziały ufności potwierdzają, że efekty są silne. To nie jest losowa zmienność. To systematyczne uprzedzenie.


Odwrócenie, które zmieniło wszystko

Oto wynik, który przekształca sposób, w jaki rozumiemy uprzedzenia AI:

Ramowanie świąteczne: AI rekomenduje o 28-61% mniej marek dla zapytań skierowanych do kobiet Ramowanie walentynkowe: AI rekomenduje o 8.8% WIĘCEJ marek dla zapytań skierowanych do kobiet na Gemini

To samo AI. Ten sam zbiór marek. Inny sezon. Przeciwny kierunek uprzedzenia.

PlatformaŚwiąteczna luka dla żonyWalentynkowa luka dla żonyZmiana sezonowa
Gemini-41% marek+8.8% marekodwrócenie o 49.8%
GPT-15% marek+12.1% marekodwrócenie o 27.1%
Grok-35% marek-2.3% marekodwrócenie o 32.7%

Sezonowe odwrócenie uprzedzenia: Święta a Walentynki

-41-15-358.812.1-2.3GeminiGPTGrok−40−30−20−10010
Luka dla żony w Święta (%)Luka dla żony w Walentynki (%)

To odkrycie dowodzi trzech kluczowych punktów:

  1. Uprzedzenie zależy od kontekstu. Ta sama struktura zapytania daje przeciwne wyniki w różnych kontekstach sezonowych.
  2. AI nauczyło się wzorców kulturowych. Walentynki są w danych treningowych kodowane jako zorientowane na kobiety, co odwraca domyślne uprzedzenie męskie.
  3. Pojedyncze pomiary są bezużyteczne. Twoja marka może dominować w jednym kontekście sezonowym, będąc niewidoczną w innym.

Termin akademicki na to zjawisko brzmi „modulacja uprzedzenia zależna od kontekstu". Termin praktyczny brzmi: Twoja strategia widoczności w AI musi uwzględniać sezonowość, w przeciwnym razie mierzysz połowę obrazu.


69 marek przypisanych do jednej płci: pełna lista

We wszystkich trzech badaniach zidentyfikowaliśmy 69 marek, które pojawiają się wyłącznie w jednym ramowaniu płciowym:

Marki przypisane do mężczyzn (łącznie 48):

  • Technologia/gadżety: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
  • Narzędzia: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
  • Outdoor: Traeger, Weber, Osprey, North Face, Patagonia (częściowo)
  • Pielęgnacja: Dollar Shave Club, Manscaped
  • Zegarki: Rolex, Omega, Seiko, Tissot
  • Sport: Titleist, Under Armour, Theragun (tylko Święta)

Marki przypisane do kobiet (łącznie 17):

  • Dom: Stanley, KitchenAid, Vitamix, Breville, Our Place
  • Uroda: Glossier, Kate Spade
  • Wellness: Oura (tylko Święta), Peloton (tylko Święta)
  • Czytanie: Kindle (dominacja świąteczna, neutralny w Walentynki)
  • Biżuteria: Tiffany (tylko Walentynki)

Przypisania zależne od platformy (4 marki):

  • Ray-Ban, LG, Google, Samsung pojawiają się tylko w zapytaniach czasowych/neutralnych

Uwaga do badania: Niektóre marki przesuwały się między badaniami. Theragun był przypisany do mężczyzn w Badaniu 1, a neutralny w Badaniu 3. Kindle przeszedł od 100% przypisania do żony do zależności sezonowej. Kategoryzacja płciowa w AI nie jest statyczna.

Jeśli Twoja marka jest na tej liście, dla połowy potencjalnego rynku pozostajesz niewidoczna, zależnie od tego, jak sformułowane jest pytanie. Żadna optymalizacja treści tego nie naprawi. Uprzedzenie mieszka w modelu kategorii AI, poza zasięgiem warstwy przekazu.


Mechanizm: kontrola dostępu do kategorii

Sprawdziliśmy dwie konkurencyjne hipotezy dotyczące tego, jak AI tworzy uprzedzenie płciowe:

Hipoteza 1: koncentracja stereotypowa AI wielokrotnie rekomenduje te same kilka stereotypowych marek dla zapytań żeńskich (niska różnorodność).

Hipoteza 2: kontrola dostępu do kategorii AI wyklucza całe kategorie produktów z zapytań żeńskich, lecz równomiernie rozdziela rekomendacje w obrębie dozwolonych kategorii (wysoka różnorodność przy mniejszej puli).

Analiza entropii Shannona dowiodła, że słuszna jest Hipoteza 2.

Zapytania skierowane do kobiet uzyskują 0.86-0.88 w entropii Shannona (niemal identycznie jak zapytania męskie). Współczynniki Giniego są dla zapytań żeńskich wręcz NIŻSZE (0.30-0.48) niż dla męskich (0.41-0.57), co oznacza bardziej równomierny rozkład wśród rekomendowanych marek.

AI nie posługuje się stereotypami. AI stosuje wykluczanie.

Kontrola dostępu do kategorii oznacza, że AI decyduje, które kategorie produktów są „odpowiednie" dla danej płci, a następnie wyklucza z rozważań całe zbiory marek. Marka z kategorii „kodowanej męsko" w ogóle nie trafia do puli rekomendacji dla zapytań żeńskich.

To gorsze niż stereotypizacja. Stereotypizacja przynajmniej utrzymałaby widoczność Twojej marki (nawet jeśli błędnie pozycjonowanej). Kontrola dostępu czyni Twoją markę niewidoczną dla całych wzorców zapytań.

Jak kontrola dostępu działa w praktyce

Gdy ktoś pyta „Jaki jest najlepszy prezent dla mojej żony?", AI nie przeszukuje wszystkich marek, by wybrać te stereotypowe. Działa inaczej:

  1. AI wskazuje kategorie produktów „odpowiednie dla kobiet": biżuteria, artykuły do domu, wellness, uroda, czytanie
  2. AI szuka rekomendacji marek TYLKO w tych kategoriach
  3. Marki z kategorii „kodowanych męsko" (narzędzia, gadżety technologiczne, sprzęt outdoorowy, zegarki) są wykluczane z rozważań
  4. Rekomendacje są równomiernie rozdzielane między dozwolone kategorie

Ten sam proces zachodzi odwrotnie dla zapytań o męża, tyle że z większym zbiorem dozwolonych kategorii (stąd wyższa liczba marek).

Dlatego Kindle pojawia się w zapytaniach o żonę i pomija zapytania o męża. Czytnik Amazona należy do klastra kategorii „czytanie/dom", który AI zakodowało jako odpowiedni dla kobiet. Produkt jest neutralny płciowo. Przypisanie kategorii już nie.


Zgodność między modelami: wciąż fatalna

Mimo przeanalizowania 1,279 zapytań platformy AI wciąż nie potrafią uzgodnić, które marki rekomendować:

BadaniePokrycie Gemini-GPTPokrycie Gemini-GrokPokrycie GPT-Grok
Badanie 1 (Święta, dorośli)14% (Jaccard 0.08)45% (Jaccard 0.38)28% (Jaccard 0.17)
Badanie 2 (Święta, dzieci)10% (Jaccard 0.10)42% (Jaccard 0.35)25% (Jaccard 0.20)
Badanie 3 (Walentynki)18% (Jaccard 0.12)51% (Jaccard 0.45)33% (Jaccard 0.25)

Zgodność między modelami (indeks Jaccarda) w poszczególnych badaniach

0.080.10.120.380.350.450.170.20.25Badanie 1Badanie 2Badanie 300.10.20.30.4
Gemini-GPTGemini-GrokGPT-Grok

Średnia zgodność między modelami: 20-35%.

Tłumaczenie: jeśli mierzysz swoją widoczność w AI tylko na jednej platformie, widzisz 20-35% rzeczywistości. Pozostałe 65-80% rekomendacji marek wygląda zupełnie inaczej na konkurencyjnych platformach.

Osobowości platform pozostają spójne

Trzy platformy zachowują odrębne „osobowości" we wszystkich badaniach:

GPT-5.2: minimalista marek

  • Średnio 0.1-4.7 marki na odpowiedź (najmniej ze wszystkich badań)
  • Często nie podaje żadnej konkretnej marki, woląc kategorie („rozważ smartwatch")
  • Powstrzymywanie się od wskazywania marek to świadomy wybór strategiczny, w pełni w zasięgu jego możliwości

Gemini: maksymalista marek

  • Średnio 3.7-11.9 marki na odpowiedź (najwięcej ze wszystkich badań)
  • Konsekwentnie wymienia 4-12 konkretnych marek na odpowiedź
  • Najbardziej podatny na efekty uprzedzenia płciowego (największe luki między zapytaniami męskimi a żeńskimi)

Grok: efektywny środek

  • Średnio 2.5-10.0 marki na odpowiedź
  • Najwyższa gęstość marek na znak (najbardziej skupiony na produktach)
  • Najbardziej stabilny między ramowaniami płciowymi (najmniejsze luki)

Jeśli optymalizujesz widoczność w AI bez testowania wszystkich trzech platform, optymalizujesz pod jedną osobowość, ignorując dwie pozostałe.


Metryka PASOR: pomiar tego, co naprawdę się liczy

Tradycyjne metryki, takie jak „wyświetlenia" czy „pozycje w rankingu", nie mają zastosowania do rekomendacji AI. Albo jesteś w odpowiedzi, albo jesteś niewidoczny. Nie ma pozycji 1 kontra pozycji 10.

Wprowadzamy metrykę Prompt-Adjusted Share of Recommendation (PASOR):

PASOR = (liczba wystąpień Twojej marki / łączna liczba trafnych zapytań) × 100

Przykład: Kindle w Badaniu 1 (Święta, dorośli)

  • Zapytania o żonę: 100% PASOR (39 wystąpień / 39 zapytań o żonę)
  • Zapytania o partnera: 100% PASOR (30 wystąpień / 30 zapytań o partnera)
  • Zapytania o męża: 0% PASOR (0 wystąpień / 40 zapytań o męża)
  • Ogólny PASOR: 63.4% (69 wystąpień / 109 wszystkich zapytań)

Jest jednak problem: ogólny PASOR maskuje luki płciowe. Jeśli mierzysz tylko wynik zbiorczy, umknie Ci to, że dominujesz w jednej grupie demograficznej, będąc niewidocznym dla innej.

PASOR w podziale na płeć pokazuje prawdę:

  • PASOR dla ramowania męskiego: 0%
  • PASOR dla ramowania żeńskiego: 100%
  • Luka: 100 punktów procentowych

Dla marek, którym zależy na zrównoważonej widoczności, luka liczy się bardziej niż średnia.

PASOR w praktyce: odwrócenie walentynkowe

PASOR w Badaniu 3 dla wybranych marek:

MarkaPASOR mążPASOR żonaPASOR chłopakPASOR dziewczynaLuka
Tiffany0%73%0%80%-73pp
Apple67%60%70%57%+7pp (zrównoważony)
LEGO33%20%37%23%+13pp
Kindle27%40%23%43%-13pp (neutralny w Walentynki, skrajny w Święta)

Apple osiąga niemal uniwersalny PASOR (57-70% we wszystkich ramowaniach). Tiffany jest całkowicie przypisany do zapytań żeńskich. Luka płciowa Kindle zmniejszyła się ze 100 punktów procentowych w Badaniu 1 do 13-17 punktów w Badaniu 3, co dowodzi, że przypisania kategorii mogą zmieniać się sezonowo.


Dowody statystyczne: ponad wszelką wątpliwość

Dla czytelników, którzy zastanawiają się, czy te efekty są realne, czy to tylko szum pomiarowy, oto formalna walidacja statystyczna:

Testy chi-kwadrat (niezależność kategorii i płci)

BadanieWartość χ²wartość pV CraméraSiła efektuInterpretacja
Badanie 1137.32<0.0010.23średniaOdrzucenie niezależności
Badanie 2524.32<0.0010.38średnia-dużaOdrzucenie niezależności
Badanie 389.45<0.0010.26średniaOdrzucenie niezależności

Tłumaczenie: prawdopodobieństwo, że te wzorce są losowe, wynosi mniej niż 0.1%. Kategorie produktów i ramowanie płciowe są systematycznie powiązane.

Siła efektu (luki w liczbie marek)

Porównanied Cohena95% CISiła efektuZnaczenie praktyczne
Badanie 1: mąż kontra żona (Gemini)1.24[0.89, 1.59]dużao 41% mniej marek
Badanie 2: syn kontra córka (wszystkie modele)0.82[0.61, 1.03]dużao 28% mniej marek
Badanie 3: walentynkowe ODWRÓCENIE dla żony-0.31[-0.58, -0.04]małao 8.8% WIĘCEJ marek

Siłę efektu podano z bootstrapowymi przedziałami ufności (10,000 prób). Wszystkie efekty są odporne na zmienność próby.

Walidacja krzyżowa

Wyniki zweryfikowaliśmy za pomocą ośmiu niezależnych testów statystycznych:

  1. Testy chi-kwadrat (związek kategorii z płcią)
  2. d Cohena (różnice w liczbie marek)
  3. Entropia Shannona (różnorodność wewnątrz grup płciowych)
  4. Współczynnik Giniego (koncentracja/nierówność)
  5. Indeks Jaccarda (pokrywanie się między modelami)
  6. V Craméra (siła efektu dla chi-kwadrat)
  7. Bootstrapowe przedziały ufności (test odporności)
  8. Analiza migracji marek (stabilność w czasie)

Wszystkie osiem metod zbiega się do tego samego wniosku: uprzedzenie płciowe jest systematyczne, zależne od platformy i zależne od kontekstu.

Siła efektu w poszczególnych badaniach (V Craméra)

0.230.380.26Badanie 1: Święta, dorośliBadanie 2: Święta, dzieciBadanie 3: Walentynki00.050.10.150.20.250.30.350.4

Co zmieniło się między badaniami: wzorce migracji marek

Niektóre marki zachowały spójną kategoryzację płciową we wszystkich trzech badaniach. Inne się przesunęły:

Stałe przypisania płciowe:

  • Przypisane do mężczyzn we wszystkich badaniach: Garmin, DeWalt, Milwaukee, Rolex, Omega
  • Przypisane do kobiet we wszystkich badaniach: Stanley, KitchenAid, Glossier

Zmieniona kategoryzacja:

  • Theragun: przypisany do mężczyzn (Badanie 1) → neutralny (Badanie 3)
  • Peloton: przypisany do mężczyzn (Badanie 1) → neutralny (Badanie 3)
  • Kindle: 100% przypisany do kobiet (Badanie 1) → zależny od sezonu (Badanie 3, wciąż luka 13-17pp)
  • Oura: przypisana do kobiet (Badanie 1) → neutralna (Badanie 3)

Wystąpienia tylko sezonowe:

  • Tiffany, Cartier: niewidoczne w badaniach świątecznych, przypisane do kobiet w badaniu walentynkowym
  • Ray-Ban, LG: tylko zapytania czasowe, nigdy z ramowaniem płciowym

Kluczowy wniosek: kategoryzacja płciowa AI ewoluuje. Marka przypisana do jednej płci w zeszłym kwartale mogła się przesunąć. Regularne testowanie to jedyny sposób, by znać swój aktualny status.


Dlaczego „partner" i „dziecko" nie są neutralne płciowo

We wszystkich trzech badaniach testowaliśmy język neutralny płciowo. Wyniki dowodzą, że neutralność to iluzja.

Badanie 1: „partner" = wzorzec żony

  • Zapytania o partnera dzielą 69.2% marek z zapytaniami o żonę
  • Zapytania o partnera dzielą 37.5% marek z zapytaniami o męża
  • Partner nie jest neutralny. Domyślnie przyjmuje ramowanie żeńskie.

Badanie 2: „dziecko" = wzorzec córki

  • Zapytania o dziecko dzielą 56.2% marek z zapytaniami o córkę
  • Zapytania o dziecko dzielą 42.6% marek z zapytaniami o syna
  • Dziecko nie jest neutralne. Domyślnie przyjmuje ramowanie żeńskie.

Badanie 3: „partner" = wzorzec żony (ponownie)

  • Zapytania o partnera dzielą 64.8% marek z zapytaniami o żonę
  • Zapytania o partnera dzielą 41.3% marek z zapytaniami o męża
  • Wzorzec utrzymuje się w różnych kontekstach sezonowych.

Jeśli Twoja strategia marki opiera się na pozycjonowaniu „inkluzywnym" lub „neutralnym płciowo", możesz optymalizować pod widoczność w ramowaniu żeńskim, całkowicie tracąc rekomendacje w ramowaniu męskim. AI domyślnie interpretuje neutralność jako żeńskość.


Zależność od kontekstu sezonowego: Święta a Walentynki

To wynik, który fundamentalnie zmienia sposób, w jaki rozumiemy uprzedzenia AI.

Testowana hipoteza: czy to samo ramowanie płciowe daje spójne uprzedzenie w różnych kontekstach sezonowych?

Odpowiedź: nie. Kierunek uprzedzenia się odwraca.

MetrykaŚwięta (Badania 1 i 2)Walentynki (Badanie 3)Zmiana
Luka Gemini żona kontra mąż-41% marek+8.8% marekodwrócenie o 49.8pp
Marki przypisane do kobiet17 marek12 marek (inny zbiór)-29%
Marki przypisane do mężczyzn48 marek22 marki (inny zbiór)-54%
Równowaga PASOR dla neutralnychSkłonność żeńskaBardziej zrównoważonaPoprawa

Dlaczego tak się dzieje: dane treningowe AI kodują wzorce kulturowe. Świąteczne obdarowywanie jest w kulturze zachodniej tradycyjnie ramowane męsko (mężowie kupują prezenty żonom, ojcowie dzieciom). Walentynki są ramowane żeńsko (chłopcy kupują dziewczynom, mężowie żonom).

AI nie stosuje uniwersalnego uprzedzenia płciowego. Stosuje wyuczone z danych treningowych wzorce właściwe dla konkretnego kontekstu.

To wyjaśnia, dlaczego pojedyncze pomiary wprowadzają w błąd. Marka, która dominuje w rekomendacjach świątecznych, może być niewidoczna w Walentynki, i odwrotnie. Testowanie sezonowe jest obowiązkowe dla pełnej oceny widoczności.


Co to oznacza dla Twojej marki

Jeśli działasz w kategorii „kodowanej męsko"

Przykłady: narzędzia, gadżety technologiczne, sprzęt outdoorowy, sprzęt sportowy, luksusowe zegarki

Twoja rzeczywistość:

  • Silna widoczność w zapytaniach o męża/syna/chłopaka
  • Słaba lub zerowa widoczność w zapytaniach o żonę/córkę/dziewczynę w okresie Świąt
  • Możliwa poprawa widoczności w zapytaniach żeńskich w Walentynki (zależnie od platformy)

Twoje ryzyko:

  • Utrata 40-50% potencjalnego rynku w szczytowych sezonach prezentowych
  • Optymalizacja treści tego nie naprawi; uprzedzenie tkwi w modelu kategorii AI

Twoja strategia:

  1. Testuj PASOR we wszystkich ramowaniach płciowych dla każdego kontekstu sezonowego
  2. Ustal, które konteksty sezonowe sprzyjają Twojej kategorii
  3. Planuj główne kampanie wokół korzystnych okien sezonowych
  4. Rozważ, czy przypisanie kategorii jest trafne (jeśli nie, zgłoś to zespołom AI)

Jeśli działasz w kategorii „kodowanej żeńsko"

Przykłady: biżuteria, artykuły do domu, uroda, wellness, sprzęt kuchenny

Twoja rzeczywistość:

  • Silna widoczność w zapytaniach o żonę/córkę/dziewczynę w okresie Świąt
  • Możliwa zmniejszona przewaga w Walentynki (odwrócenie sezonowe)
  • Słaba lub zerowa widoczność w zapytaniach o męża/syna/chłopaka

Twoje ryzyko:

  • Oddanie 40-50% rynku konkurentom, którzy rozwiązali problem kategorii
  • Niewidoczność dla kupujących mężczyzn, którzy chcą kupić Twój produkt dla siebie

Twoja strategia:

  1. Sprawdź, czy Twój produkt jest naprawdę specyficzny płciowo, czy tylko tak skategoryzowany
  2. Jeśli produkt jest neutralny, lecz zablokowany kategorią, twórz treści łączące kategorie
  3. Monitoruj przesunięcia sezonowe; Twoja walentynkowa przewaga może nie utrzymać się przez cały rok

Jeśli jesteś zależny od platformy

Przykłady: Ray-Ban, Samsung, Google (wyłącznie wystąpienia czasowe), Tiffany (tylko Walentynki)

Twoja rzeczywistość:

  • Niewidoczność w standardowych zapytaniach z ramowaniem płciowym
  • Pojawianie się tylko w kontekstach czasowych lub sezonowych
  • Możliwe wykluczenie z danych treningowych LLM lub spadek poniżej progów rekomendacji

Twoja strategia:

  1. Zbadaj, dlaczego nie ma Cię w standardowych rekomendacjach
  2. Zwiększ liczbę wzmianek o marce w kontekstach wykorzystywanych przez AI do treningu
  3. Sprawdź, czy inne struktury zapytań otwierają widoczność

Jeśli osiągasz zrównoważony PASOR (jak Apple)

Marki zrównoważone: Apple, Sony, Bose, LEGO, Patagonia, Nintendo

Twoja rzeczywistość:

  • Spójne pojawianie się we wszystkich ramowaniach płciowych (zmienność ±10-15%)
  • Utrzymanie widoczności w różnych kontekstach sezonowych
  • Brak przypisania do konkretnej kategorii demograficznej

Twoja przewaga:

  • Maksymalny zasięg rekomendacji we wszystkich typach zapytań
  • Niższe ryzyko wahań sezonowych
  • Lepsza ochrona przed kontrolą dostępu do kategorii

Twoja strategia:

  1. Utrzymuj zrównoważone pozycjonowanie we wszystkich treściach
  2. Monitoruj dryf kategorii, który mógłby przypisać Cię do jednej grupy demograficznej
  3. Wykorzystaj zrównoważony status jako przewagę konkurencyjną

Walidacja akademicka: recenzja naukowa ma znaczenie

To badanie zostało złożone do czasopisma Human-Centric Intelligent Systems wydawnictwa Springer, recenzowanej publikacji naukowej z dziedziny AI i interakcji człowiek-komputer.

Dlaczego to ważne:

  1. Niezależna recenzja: trzech anonimowych ekspertów w dziedzinie badań nad uprzedzeniami AI zweryfikuje metodologię, rygor statystyczny i wnioski przed publikacją.

  2. Odtwarzalność: pełna metodologia, testy statystyczne i siła efektu są udokumentowane. Inni badacze mogą powtórzyć wyniki.

  3. Trwałość cytowań: po publikacji to badanie stanie się częścią trwałego dorobku naukowego o uprzedzeniach AI, cytowanego w przyszłych pracach.

  4. Wiarygodność w branży: walidacja akademicka ma znaczenie dla klientów korporacyjnych, regulatorów i mediów.

Pakiet zgłoszeniowy obejmuje:

  • Pełną pracę (30 stron, przeanalizowano 1,279 obserwacji)
  • Aneks statystyczny ze wszystkimi ośmioma testami walidacyjnymi
  • Oświadczenie o dostępności danych źródłowych
  • Oświadczenie o konflikcie interesów (badanie finansowane przez Rankfor.AI, autor jest założycielem)

Obecny status: w trakcie recenzji (złożono w lutym 2026). Spodziewana decyzja: kwiecień-maj 2026.

Jeśli prezentujesz to badanie kadrze zarządzającej, regulatorom lub dziennikarzom, możesz je cytować jako „w trakcie recenzji w Springer Human-Centric Intelligent Systems". Po przyjęciu stanie się cytowalną literaturą naukową.


Konsekwencje dla badań nad uczciwością AI

To badanie wnosi wkład do szerszej literatury o uczciwości AI na trzy sposoby:

1. Modulacja uprzedzenia zależna od kontekstu

Wcześniejsze prace nad uprzedzeniami AI zakładają, że uprzedzenie jest statyczne; jeśli model jest uprzedzony, stosuje to uprzedzenie konsekwentnie. Nasze wyniki dowodzą, że dla rekomendacji LLM to założenie jest błędne.

Kluczowy wkład: uprzedzenie płciowe w komercyjnym AI nie jest stałym parametrem. Modulują je kontekst sezonowy, typ odbiorcy i ramowanie relacji. Audyty uczciwości, które testują tylko jeden kontekst, przeoczą odwrócenia w innych kontekstach.

2. Wyzwania uczenia w otwartym świecie

LLM działają w środowiskach otwartego świata, w których zapytania użytkowników obejmują nieograniczone konteksty demograficzne i sezonowe. Tradycyjne wykrywanie uprzedzeń w zamkniętym świecie (testowanie na stałych zbiorach danych) nie jest w stanie uchwycić tej złożoności.

Kluczowy wkład: pokazujemy, że uprzedzenie LLM przejawia się różnie w kontekstach sezonowych, które w danych treningowych były prawdopodobnie niedoreprezentowane. Odpowiada to badaniom nad uczeniem w otwartym świecie, dotyczącym tego, jak modele generalizują poza rozkłady treningowe.

3. Kontrola dostępu do kategorii jako mechanizm uprzedzenia

Większość badań nad uprzedzeniami skupia się na koncentracji stereotypowej (wielokrotne rekomendowanie tych samych kilku opcji). My wskazujemy inny mechanizm.

Kluczowy wkład: AI nie stereotypizuje zapytań skierowanych do kobiet wąskimi zbiorami marek. Wyklucza z rozważań całe kategorie produktów, a następnie równomiernie rozdziela rekomendacje w obrębie dozwolonych kategorii. Tę „kontrolę dostępu do kategorii" trudniej wykryć, bo metryki różnorodności (entropia Shannona, współczynnik Giniego) wyglądają normalnie.


Co powinieneś teraz zrobić

1. Przeprowadź wielosezonowy audyt PASOR

Przetestuj swoją markę pod kątem:

  • Wszystkich ramowań płciowych (mąż/żona/chłopak/dziewczyna/partner)
  • Wszystkich kontekstów sezonowych (Święta, Walentynki, Dzień Matki/Ojca, urodziny)
  • Wszystkich trzech głównych platform (Gemini, GPT, Grok)

Zmierz PASOR dla każdej kombinacji. Ustal, gdzie jesteś widoczny, gdzie zablokowany i czy dotyczą Cię odwrócenia sezonowe.

2. Sprawdź przypisanie swojej kategorii

Jeśli jesteś przypisany do jednej płci, a Twój produkt jest naprawdę neutralny płciowo, zbadaj:

  • Z jakimi kategoriami produktów AI kojarzy Twoją markę?
  • Czy te kategorie są w odpowiedziach AI kodowane jako męskie, czy żeńskie?
  • Czy możesz połączyć kategorie treściami, które przekraczają granice demograficzne?

3. Monitoruj migrację marki

Nasze badanie dowodzi, że kategoryzacja płciowa nie jest statyczna. Marki przesuwają się między badaniami. Wprowadź testowanie kwartalne, by wykryć zmianę swojego statusu.

4. Segmentuj swoje metryki widoczności

Ogólny PASOR ukrywa luki płciowe. Zawsze raportuj:

  • PASOR dla ramowania męskiego (mąż/syn/chłopak)
  • PASOR dla ramowania żeńskiego (żona/córka/dziewczyna)
  • PASOR dla ramowania neutralnego (partner/dziecko)
  • Lukę między męskim a żeńskim (liczy się bardziej niż średnia)

5. Dostosuj strategię do sezonu

Jeśli odkryjesz odwrócenia sezonowe (jak przejście od Świąt do Walentynek), zaplanuj kampanie odpowiednio:

  • Wzmacniaj przekaz skierowany do kobiet w sezonach, gdy zapytania żeńskie otrzymują więcej marek
  • Wzmacniaj przekaz skierowany do mężczyzn w sezonach, gdy dominują zapytania męskie
  • Testuj nowe konteksty sezonowe (Prime Day, Black Friday, powrót do szkoły)

Sprawdź, czy Twoja marka jest przypisana do jednej płci

Zbudowaliśmy darmowe narzędzie, które przeprowadza Twoją markę przez tę samą analizę, której użyliśmy w tym badaniu.

Co zobaczysz:

  • Wyniki PASOR we wszystkich ramowaniach płciowych
  • Które konteksty sezonowe sprzyjają Twojej marce
  • Jak Twoja widoczność wypada na Gemini, GPT i Grok
  • Czy jesteś zablokowany kategorią jak Kindle, czy zrównoważony jak Apple

Trzy zapytania. Trzy platformy. Trzy konteksty sezonowe. Natychmiastowa analiza PASOR.

Bez podawania e-maila. Zajmuje 90 sekund.

Sprawdź status przypisania płciowego swojej marki


Podsumowanie metodologii

  • Łączna liczba zapytań: 1,279 (299 + 480 + 500 w trzech badaniach)
  • Testowane platformy: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
  • Zapytania na badanie:
    • Badanie 1: 4 warunki (mąż/żona/partner/2025)
    • Badanie 2: 4 warunki (syn/córka/dziecko/2026)
    • Badanie 3: 5 warunków (mąż/żona/chłopak/dziewczyna/partner)
  • Temperatura: 0.7 (Badania 2-3), domyślna (Badanie 1)
  • Zbieranie danych: grudzień 2025 - luty 2026
  • Walidacja statystyczna: testy chi-kwadrat, d Cohena, V Craméra, entropia Shannona, współczynnik Giniego, indeks Jaccarda, bootstrapowe przedziały ufności
  • Siła efektu: średnia do dużej (V Craméra = 0.23-0.38, d Cohena = 0.82-1.24)
  • Recenzja naukowa: złożono do Springer Human-Centric Intelligent Systems, luty 2026

Pełny aneks statystyczny i dane źródłowe dostępne na życzenie. W sprawie współpracy naukowej pisz na research@rankfor.ai.


Powiązane badania

Kindle: 100% zapytań o żonę. 0% zapytań o męża. To samo AI.

Nasze pierwsze odkrycie (grudzień 2025, n=299), które zidentyfikowało zjawisko Kindle i stworzyło statystyczny fundament dla uprzedzenia płciowego w rekomendacjach LLM. To badanie stało się Badaniem 1 w analizie trzech badań.

Kluczowy wynik: o 41% mniej marek dla zapytań o żonę. Chi-kwadrat 137.32, p<0.001.

Tylko 2 marki są widoczne na wszystkich platformach AI. Czy Twoja jest jedną z nich?

Badanie z dziećmi jako odbiorcami (styczeń 2026, n=480), które dowiodło, że uprzedzenie płciowe wykracza poza konteksty dorosłych, i wykazało, że uniwersalna widoczność jest niemal nieosiągalna. To badanie stało się Badaniem 2 w analizie trzech badań.

Kluczowy wynik: tylko LEGO i Disney osiągają uniwersalną widoczność na wielu platformach. O 28% mniej marek dla zapytań o córkę.


Badanie przeprowadził Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Złożone do Springer Human-Centric Intelligent Systems, luty 2026. Pełna praca, aneks statystyczny i dane źródłowe dostępne na życzenie.


Kluczowe pojęcia

PASOR (Prompt-Adjusted Share of Recommendation): odsetek trafnych zapytań, w których Twoja marka pojawia się w odpowiedziach AI. W odróżnieniu od tradycyjnych rankingów PASOR mierzy sam fakt obecności marki w odpowiedzi, w oderwaniu od jej pozycji.

Kontrola dostępu do kategorii (category gatekeeping): sytuacja, w której AI wyklucza całe kategorie produktów z zapytań przypisanych do danej płci, blokując im dostęp do rekomendacji. Analiza entropii Shannona wskazała to jako główny mechanizm uprzedzenia.

Marka przypisana do jednej płci (gender-locked): marka, która pojawia się wyłącznie w jednym ramowaniu płciowym (np. tylko w zapytaniach o męża) i nigdy w pozostałych. W trzech badaniach zidentyfikowaliśmy 69 takich marek.

Sezonowe odwrócenie uprzedzenia: sytuacja, w której kierunek uprzedzenia płciowego zmienia się wraz z kontekstem sezonowym. Święta zmniejszają liczbę rekomendacji dla ramowania żeńskiego o 28-61%, podczas gdy Walentynki zwiększają ją o 8.8% (Gemini).

Zgodność między modelami (indeks Jaccarda): odsetek marek rekomendowanych przez wiele platform AI dla tego samego zapytania. Niska zgodność (10-45% w naszych badaniach) oznacza widoczność zależną od platformy.

V Craméra: miara siły związku dla testów chi-kwadrat, w zakresie od 0 (brak związku) do 1 (związek doskonały). Wartości 0.23-0.38 wskazują na średni do dużego związek między płcią a kategorią w naszych badaniach.

d Cohena: wystandaryzowana miara różnicy między dwiema grupami. Wartości 0.82-1.24 wskazują na duże praktyczne różnice w liczbie marek między ramowaniami płciowymi.

Migracja marki: sytuacja, w której kategoryzacja płciowa marki zmienia się między okresami pomiaru. Theragun, Peloton i Oura przeszły od przypisania do jednej płci do neutralności między badaniami.

People Also Ask

Continue Reading

research

70% of AI Gift Recommendations Are Gender-Locked

150 queries on Valentine's Day 2026 across three AI models reveal 70% of brand recommendations are gender-exclusive. Gemini names 11.4 brands per response vs 1.3 for Grok and 1.2 for OpenAI. Only Away and Ember transcend gender silos. Female-framed prompts now get 16.2% more brands than male - the opposite of Christmas.

research

Four-Prompt Gender Bias Analysis: Isolating Gender Effects in LLM Brand Recommendations

This study extends cross-prompt LLM brand consistency analysis by introducing a gender-neutral "partner" prompt to isolate gender bias effects. Comparing four prompt variations across 299 total samples, we provide strong evidence of gender-based brand recommendation bias in LLMs. Critical finding: Kindle appeared in 100% of wife AND partner iterations but 0% of husband iterations.

research

Only 2 Brands Are Visible Across All AI Platforms. Is Yours One of Them?

We ran 480 queries across three AI platforms. Cross-model agreement on brand recommendations was only 10-45%. We identified 26 gender-locked brands, discovered that only LEGO and Disney achieve universal visibility, and found that AI recommends 41% fewer brands for wife queries than husband queries.

research

Cross-Model Response Stability Analysis: A Comparative Study of Brand Mention Consistency in Large Language Models

This study investigates response variability and brand mention consistency across three leading LLMs: Google Gemini 3 Flash, OpenAI GPT-5.2, and xAI Grok-4-1. Using 239 total samples across three prompt variations (husband, wife, 2025), we measured brand mention frequency, response consistency, and cross-model agreement.

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder & Lead Researcher

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

Używamy plików cookie

Używamy niezbędnych plików cookie do działania strony. Za Twoją zgodą możemy również używać plików cookie analitycznych, aby zrozumieć, jak korzystasz z naszych narzędzi (takich jak Dice Roller), dzięki czemu możemy je ulepszać. Dowiedz się więcej