Przeprowadziliśmy 1,279 zapytań na trzech platformach AI w dwóch sezonach prezentowych. Wynik: jednoznaczny dowód statystyczny, że AI traktuje marki różnie w zależności od płci, oraz że kierunek uprzedzenia zmienia się zależnie od tego, czy pytasz w okresie Świąt, czy Walentynek.
Odkrycie, które zakończyło dyskusję
Od roku dokumentujemy uprzedzenia płciowe w rekomendacjach marek generowanych przez AI. Najpierw odkryliśmy zjawisko Kindle: 100% widoczności dla zapytań o żonę, 0% dla zapytań o męża. Następnie rozszerzyliśmy badanie na dzieci jako odbiorców i uprzedzenie się utrzymało: o 28% mniej marek dla córek niż dla synów.
Niektórzy twierdzili, że to odosobnione przypadki. Kaprysy platform. Losowa zmienność. Szum statystyczny.
To badanie kończy tę dyskusję.
1,279 zapytań. Trzy uzupełniające się badania. Dwa konteksty sezonowe. Jeden wniosek: uprzedzenie płciowe w rekomendacjach AI jest systematyczne, udowodnione statystycznie i zależne od kontekstu.
Praca, złożona do czasopisma Human-Centric Intelligent Systems wydawnictwa Springer, stanowi formalne akademickie potwierdzenie tego, co najpierw zaobserwowaliśmy w testach na rzeczywistych danych. Dowody statystyczne nie pozostawiają już miejsca na dyskusję.
Projekt trzech badań: dlaczego te wyniki są rozstrzygające
Większość badań nad uprzedzeniami sprawdza jeden scenariusz i na tym poprzestaje. Zaprojektowaliśmy trzy powiązane badania, aby wykluczyć każde alternatywne wyjaśnienie:
Badanie 1: prezenty świąteczne dla dorosłych (grudzień 2025, n=299)
Testowane zapytania: mąż/żona/partner/prezent 2025 Kluczowy wynik: o 41% mniej marek dla zapytań o żonę na Gemini Dowód statystyczny: χ² = 137.32, p < 0.001
Badanie 2: prezenty świąteczne dla dzieci (styczeń 2026, n=480)
Testowane zapytania: syn/córka/dziecko/prezent 2026 Kluczowy wynik: o 28% mniej marek dla zapytań o córkę na wszystkich platformach Dowód statystyczny: χ² = 524.32, p < 0.001 (niemal 4-krotnie silniejszy niż w Badaniu 1)
Badanie 3: prezenty walentynkowe dla partnerów (luty 2026, n=500)
Testowane zapytania: mąż/żona/chłopak/dziewczyna/partner Kluczowy wynik: sezonowe ODWRÓCENIE, zapytania z żeńskim ramowaniem otrzymują o 8.8% WIĘCEJ marek na Gemini Dowód statystyczny: χ² = 89.45, p < 0.001
Analiza łączna: 1,279 niezależnych obserwacji w 12 warunkach zapytań i na 3 platformach AI.
Trzy badania: wielkość próby i luka płci w podziale na badanie
Potwierdzenie statystyczne jest przytłaczające. Wartości V Craméra na poziomie 0.23-0.38 wskazują na średnią do dużej siłę efektu. Bootstrapowe przedziały ufności potwierdzają, że efekty są silne. To nie jest losowa zmienność. To systematyczne uprzedzenie.
Odwrócenie, które zmieniło wszystko
Oto wynik, który przekształca sposób, w jaki rozumiemy uprzedzenia AI:
Ramowanie świąteczne: AI rekomenduje o 28-61% mniej marek dla zapytań skierowanych do kobiet Ramowanie walentynkowe: AI rekomenduje o 8.8% WIĘCEJ marek dla zapytań skierowanych do kobiet na Gemini
To samo AI. Ten sam zbiór marek. Inny sezon. Przeciwny kierunek uprzedzenia.
| Platforma | Świąteczna luka dla żony | Walentynkowa luka dla żony | Zmiana sezonowa |
|---|---|---|---|
| Gemini | -41% marek | +8.8% marek | odwrócenie o 49.8% |
| GPT | -15% marek | +12.1% marek | odwrócenie o 27.1% |
| Grok | -35% marek | -2.3% marek | odwrócenie o 32.7% |
Sezonowe odwrócenie uprzedzenia: Święta a Walentynki
To odkrycie dowodzi trzech kluczowych punktów:
- Uprzedzenie zależy od kontekstu. Ta sama struktura zapytania daje przeciwne wyniki w różnych kontekstach sezonowych.
- AI nauczyło się wzorców kulturowych. Walentynki są w danych treningowych kodowane jako zorientowane na kobiety, co odwraca domyślne uprzedzenie męskie.
- Pojedyncze pomiary są bezużyteczne. Twoja marka może dominować w jednym kontekście sezonowym, będąc niewidoczną w innym.
Termin akademicki na to zjawisko brzmi „modulacja uprzedzenia zależna od kontekstu". Termin praktyczny brzmi: Twoja strategia widoczności w AI musi uwzględniać sezonowość, w przeciwnym razie mierzysz połowę obrazu.
69 marek przypisanych do jednej płci: pełna lista
We wszystkich trzech badaniach zidentyfikowaliśmy 69 marek, które pojawiają się wyłącznie w jednym ramowaniu płciowym:
Marki przypisane do mężczyzn (łącznie 48):
- Technologia/gadżety: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
- Narzędzia: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
- Outdoor: Traeger, Weber, Osprey, North Face, Patagonia (częściowo)
- Pielęgnacja: Dollar Shave Club, Manscaped
- Zegarki: Rolex, Omega, Seiko, Tissot
- Sport: Titleist, Under Armour, Theragun (tylko Święta)
Marki przypisane do kobiet (łącznie 17):
- Dom: Stanley, KitchenAid, Vitamix, Breville, Our Place
- Uroda: Glossier, Kate Spade
- Wellness: Oura (tylko Święta), Peloton (tylko Święta)
- Czytanie: Kindle (dominacja świąteczna, neutralny w Walentynki)
- Biżuteria: Tiffany (tylko Walentynki)
Przypisania zależne od platformy (4 marki):
- Ray-Ban, LG, Google, Samsung pojawiają się tylko w zapytaniach czasowych/neutralnych
Uwaga do badania: Niektóre marki przesuwały się między badaniami. Theragun był przypisany do mężczyzn w Badaniu 1, a neutralny w Badaniu 3. Kindle przeszedł od 100% przypisania do żony do zależności sezonowej. Kategoryzacja płciowa w AI nie jest statyczna.
Jeśli Twoja marka jest na tej liście, dla połowy potencjalnego rynku pozostajesz niewidoczna, zależnie od tego, jak sformułowane jest pytanie. Żadna optymalizacja treści tego nie naprawi. Uprzedzenie mieszka w modelu kategorii AI, poza zasięgiem warstwy przekazu.
Mechanizm: kontrola dostępu do kategorii
Sprawdziliśmy dwie konkurencyjne hipotezy dotyczące tego, jak AI tworzy uprzedzenie płciowe:
Hipoteza 1: koncentracja stereotypowa AI wielokrotnie rekomenduje te same kilka stereotypowych marek dla zapytań żeńskich (niska różnorodność).
Hipoteza 2: kontrola dostępu do kategorii AI wyklucza całe kategorie produktów z zapytań żeńskich, lecz równomiernie rozdziela rekomendacje w obrębie dozwolonych kategorii (wysoka różnorodność przy mniejszej puli).
Analiza entropii Shannona dowiodła, że słuszna jest Hipoteza 2.
Zapytania skierowane do kobiet uzyskują 0.86-0.88 w entropii Shannona (niemal identycznie jak zapytania męskie). Współczynniki Giniego są dla zapytań żeńskich wręcz NIŻSZE (0.30-0.48) niż dla męskich (0.41-0.57), co oznacza bardziej równomierny rozkład wśród rekomendowanych marek.
AI nie posługuje się stereotypami. AI stosuje wykluczanie.
Kontrola dostępu do kategorii oznacza, że AI decyduje, które kategorie produktów są „odpowiednie" dla danej płci, a następnie wyklucza z rozważań całe zbiory marek. Marka z kategorii „kodowanej męsko" w ogóle nie trafia do puli rekomendacji dla zapytań żeńskich.
To gorsze niż stereotypizacja. Stereotypizacja przynajmniej utrzymałaby widoczność Twojej marki (nawet jeśli błędnie pozycjonowanej). Kontrola dostępu czyni Twoją markę niewidoczną dla całych wzorców zapytań.
Jak kontrola dostępu działa w praktyce
Gdy ktoś pyta „Jaki jest najlepszy prezent dla mojej żony?", AI nie przeszukuje wszystkich marek, by wybrać te stereotypowe. Działa inaczej:
- AI wskazuje kategorie produktów „odpowiednie dla kobiet": biżuteria, artykuły do domu, wellness, uroda, czytanie
- AI szuka rekomendacji marek TYLKO w tych kategoriach
- Marki z kategorii „kodowanych męsko" (narzędzia, gadżety technologiczne, sprzęt outdoorowy, zegarki) są wykluczane z rozważań
- Rekomendacje są równomiernie rozdzielane między dozwolone kategorie
Ten sam proces zachodzi odwrotnie dla zapytań o męża, tyle że z większym zbiorem dozwolonych kategorii (stąd wyższa liczba marek).
Dlatego Kindle pojawia się w zapytaniach o żonę i pomija zapytania o męża. Czytnik Amazona należy do klastra kategorii „czytanie/dom", który AI zakodowało jako odpowiedni dla kobiet. Produkt jest neutralny płciowo. Przypisanie kategorii już nie.
Zgodność między modelami: wciąż fatalna
Mimo przeanalizowania 1,279 zapytań platformy AI wciąż nie potrafią uzgodnić, które marki rekomendować:
| Badanie | Pokrycie Gemini-GPT | Pokrycie Gemini-Grok | Pokrycie GPT-Grok |
|---|---|---|---|
| Badanie 1 (Święta, dorośli) | 14% (Jaccard 0.08) | 45% (Jaccard 0.38) | 28% (Jaccard 0.17) |
| Badanie 2 (Święta, dzieci) | 10% (Jaccard 0.10) | 42% (Jaccard 0.35) | 25% (Jaccard 0.20) |
| Badanie 3 (Walentynki) | 18% (Jaccard 0.12) | 51% (Jaccard 0.45) | 33% (Jaccard 0.25) |
Zgodność między modelami (indeks Jaccarda) w poszczególnych badaniach
Średnia zgodność między modelami: 20-35%.
Tłumaczenie: jeśli mierzysz swoją widoczność w AI tylko na jednej platformie, widzisz 20-35% rzeczywistości. Pozostałe 65-80% rekomendacji marek wygląda zupełnie inaczej na konkurencyjnych platformach.
Osobowości platform pozostają spójne
Trzy platformy zachowują odrębne „osobowości" we wszystkich badaniach:
GPT-5.2: minimalista marek
- Średnio 0.1-4.7 marki na odpowiedź (najmniej ze wszystkich badań)
- Często nie podaje żadnej konkretnej marki, woląc kategorie („rozważ smartwatch")
- Powstrzymywanie się od wskazywania marek to świadomy wybór strategiczny, w pełni w zasięgu jego możliwości
Gemini: maksymalista marek
- Średnio 3.7-11.9 marki na odpowiedź (najwięcej ze wszystkich badań)
- Konsekwentnie wymienia 4-12 konkretnych marek na odpowiedź
- Najbardziej podatny na efekty uprzedzenia płciowego (największe luki między zapytaniami męskimi a żeńskimi)
Grok: efektywny środek
- Średnio 2.5-10.0 marki na odpowiedź
- Najwyższa gęstość marek na znak (najbardziej skupiony na produktach)
- Najbardziej stabilny między ramowaniami płciowymi (najmniejsze luki)
Jeśli optymalizujesz widoczność w AI bez testowania wszystkich trzech platform, optymalizujesz pod jedną osobowość, ignorując dwie pozostałe.
Metryka PASOR: pomiar tego, co naprawdę się liczy
Tradycyjne metryki, takie jak „wyświetlenia" czy „pozycje w rankingu", nie mają zastosowania do rekomendacji AI. Albo jesteś w odpowiedzi, albo jesteś niewidoczny. Nie ma pozycji 1 kontra pozycji 10.
Wprowadzamy metrykę Prompt-Adjusted Share of Recommendation (PASOR):
PASOR = (liczba wystąpień Twojej marki / łączna liczba trafnych zapytań) × 100
Przykład: Kindle w Badaniu 1 (Święta, dorośli)
- Zapytania o żonę: 100% PASOR (39 wystąpień / 39 zapytań o żonę)
- Zapytania o partnera: 100% PASOR (30 wystąpień / 30 zapytań o partnera)
- Zapytania o męża: 0% PASOR (0 wystąpień / 40 zapytań o męża)
- Ogólny PASOR: 63.4% (69 wystąpień / 109 wszystkich zapytań)
Jest jednak problem: ogólny PASOR maskuje luki płciowe. Jeśli mierzysz tylko wynik zbiorczy, umknie Ci to, że dominujesz w jednej grupie demograficznej, będąc niewidocznym dla innej.
PASOR w podziale na płeć pokazuje prawdę:
- PASOR dla ramowania męskiego: 0%
- PASOR dla ramowania żeńskiego: 100%
- Luka: 100 punktów procentowych
Dla marek, którym zależy na zrównoważonej widoczności, luka liczy się bardziej niż średnia.
PASOR w praktyce: odwrócenie walentynkowe
PASOR w Badaniu 3 dla wybranych marek:
| Marka | PASOR mąż | PASOR żona | PASOR chłopak | PASOR dziewczyna | Luka |
|---|---|---|---|---|---|
| Tiffany | 0% | 73% | 0% | 80% | -73pp |
| Apple | 67% | 60% | 70% | 57% | +7pp (zrównoważony) |
| LEGO | 33% | 20% | 37% | 23% | +13pp |
| Kindle | 27% | 40% | 23% | 43% | -13pp (neutralny w Walentynki, skrajny w Święta) |
Apple osiąga niemal uniwersalny PASOR (57-70% we wszystkich ramowaniach). Tiffany jest całkowicie przypisany do zapytań żeńskich. Luka płciowa Kindle zmniejszyła się ze 100 punktów procentowych w Badaniu 1 do 13-17 punktów w Badaniu 3, co dowodzi, że przypisania kategorii mogą zmieniać się sezonowo.
Dowody statystyczne: ponad wszelką wątpliwość
Dla czytelników, którzy zastanawiają się, czy te efekty są realne, czy to tylko szum pomiarowy, oto formalna walidacja statystyczna:
Testy chi-kwadrat (niezależność kategorii i płci)
| Badanie | Wartość χ² | wartość p | V Craméra | Siła efektu | Interpretacja |
|---|---|---|---|---|---|
| Badanie 1 | 137.32 | <0.001 | 0.23 | średnia | Odrzucenie niezależności |
| Badanie 2 | 524.32 | <0.001 | 0.38 | średnia-duża | Odrzucenie niezależności |
| Badanie 3 | 89.45 | <0.001 | 0.26 | średnia | Odrzucenie niezależności |
Tłumaczenie: prawdopodobieństwo, że te wzorce są losowe, wynosi mniej niż 0.1%. Kategorie produktów i ramowanie płciowe są systematycznie powiązane.
Siła efektu (luki w liczbie marek)
| Porównanie | d Cohena | 95% CI | Siła efektu | Znaczenie praktyczne |
|---|---|---|---|---|
| Badanie 1: mąż kontra żona (Gemini) | 1.24 | [0.89, 1.59] | duża | o 41% mniej marek |
| Badanie 2: syn kontra córka (wszystkie modele) | 0.82 | [0.61, 1.03] | duża | o 28% mniej marek |
| Badanie 3: walentynkowe ODWRÓCENIE dla żony | -0.31 | [-0.58, -0.04] | mała | o 8.8% WIĘCEJ marek |
Siłę efektu podano z bootstrapowymi przedziałami ufności (10,000 prób). Wszystkie efekty są odporne na zmienność próby.
Walidacja krzyżowa
Wyniki zweryfikowaliśmy za pomocą ośmiu niezależnych testów statystycznych:
- Testy chi-kwadrat (związek kategorii z płcią)
- d Cohena (różnice w liczbie marek)
- Entropia Shannona (różnorodność wewnątrz grup płciowych)
- Współczynnik Giniego (koncentracja/nierówność)
- Indeks Jaccarda (pokrywanie się między modelami)
- V Craméra (siła efektu dla chi-kwadrat)
- Bootstrapowe przedziały ufności (test odporności)
- Analiza migracji marek (stabilność w czasie)
Wszystkie osiem metod zbiega się do tego samego wniosku: uprzedzenie płciowe jest systematyczne, zależne od platformy i zależne od kontekstu.
Siła efektu w poszczególnych badaniach (V Craméra)
Co zmieniło się między badaniami: wzorce migracji marek
Niektóre marki zachowały spójną kategoryzację płciową we wszystkich trzech badaniach. Inne się przesunęły:
Stałe przypisania płciowe:
- Przypisane do mężczyzn we wszystkich badaniach: Garmin, DeWalt, Milwaukee, Rolex, Omega
- Przypisane do kobiet we wszystkich badaniach: Stanley, KitchenAid, Glossier
Zmieniona kategoryzacja:
- Theragun: przypisany do mężczyzn (Badanie 1) → neutralny (Badanie 3)
- Peloton: przypisany do mężczyzn (Badanie 1) → neutralny (Badanie 3)
- Kindle: 100% przypisany do kobiet (Badanie 1) → zależny od sezonu (Badanie 3, wciąż luka 13-17pp)
- Oura: przypisana do kobiet (Badanie 1) → neutralna (Badanie 3)
Wystąpienia tylko sezonowe:
- Tiffany, Cartier: niewidoczne w badaniach świątecznych, przypisane do kobiet w badaniu walentynkowym
- Ray-Ban, LG: tylko zapytania czasowe, nigdy z ramowaniem płciowym
Kluczowy wniosek: kategoryzacja płciowa AI ewoluuje. Marka przypisana do jednej płci w zeszłym kwartale mogła się przesunąć. Regularne testowanie to jedyny sposób, by znać swój aktualny status.
Dlaczego „partner" i „dziecko" nie są neutralne płciowo
We wszystkich trzech badaniach testowaliśmy język neutralny płciowo. Wyniki dowodzą, że neutralność to iluzja.
Badanie 1: „partner" = wzorzec żony
- Zapytania o partnera dzielą 69.2% marek z zapytaniami o żonę
- Zapytania o partnera dzielą 37.5% marek z zapytaniami o męża
- Partner nie jest neutralny. Domyślnie przyjmuje ramowanie żeńskie.
Badanie 2: „dziecko" = wzorzec córki
- Zapytania o dziecko dzielą 56.2% marek z zapytaniami o córkę
- Zapytania o dziecko dzielą 42.6% marek z zapytaniami o syna
- Dziecko nie jest neutralne. Domyślnie przyjmuje ramowanie żeńskie.
Badanie 3: „partner" = wzorzec żony (ponownie)
- Zapytania o partnera dzielą 64.8% marek z zapytaniami o żonę
- Zapytania o partnera dzielą 41.3% marek z zapytaniami o męża
- Wzorzec utrzymuje się w różnych kontekstach sezonowych.
Jeśli Twoja strategia marki opiera się na pozycjonowaniu „inkluzywnym" lub „neutralnym płciowo", możesz optymalizować pod widoczność w ramowaniu żeńskim, całkowicie tracąc rekomendacje w ramowaniu męskim. AI domyślnie interpretuje neutralność jako żeńskość.
Zależność od kontekstu sezonowego: Święta a Walentynki
To wynik, który fundamentalnie zmienia sposób, w jaki rozumiemy uprzedzenia AI.
Testowana hipoteza: czy to samo ramowanie płciowe daje spójne uprzedzenie w różnych kontekstach sezonowych?
Odpowiedź: nie. Kierunek uprzedzenia się odwraca.
| Metryka | Święta (Badania 1 i 2) | Walentynki (Badanie 3) | Zmiana |
|---|---|---|---|
| Luka Gemini żona kontra mąż | -41% marek | +8.8% marek | odwrócenie o 49.8pp |
| Marki przypisane do kobiet | 17 marek | 12 marek (inny zbiór) | -29% |
| Marki przypisane do mężczyzn | 48 marek | 22 marki (inny zbiór) | -54% |
| Równowaga PASOR dla neutralnych | Skłonność żeńska | Bardziej zrównoważona | Poprawa |
Dlaczego tak się dzieje: dane treningowe AI kodują wzorce kulturowe. Świąteczne obdarowywanie jest w kulturze zachodniej tradycyjnie ramowane męsko (mężowie kupują prezenty żonom, ojcowie dzieciom). Walentynki są ramowane żeńsko (chłopcy kupują dziewczynom, mężowie żonom).
AI nie stosuje uniwersalnego uprzedzenia płciowego. Stosuje wyuczone z danych treningowych wzorce właściwe dla konkretnego kontekstu.
To wyjaśnia, dlaczego pojedyncze pomiary wprowadzają w błąd. Marka, która dominuje w rekomendacjach świątecznych, może być niewidoczna w Walentynki, i odwrotnie. Testowanie sezonowe jest obowiązkowe dla pełnej oceny widoczności.
Co to oznacza dla Twojej marki
Jeśli działasz w kategorii „kodowanej męsko"
Przykłady: narzędzia, gadżety technologiczne, sprzęt outdoorowy, sprzęt sportowy, luksusowe zegarki
Twoja rzeczywistość:
- Silna widoczność w zapytaniach o męża/syna/chłopaka
- Słaba lub zerowa widoczność w zapytaniach o żonę/córkę/dziewczynę w okresie Świąt
- Możliwa poprawa widoczności w zapytaniach żeńskich w Walentynki (zależnie od platformy)
Twoje ryzyko:
- Utrata 40-50% potencjalnego rynku w szczytowych sezonach prezentowych
- Optymalizacja treści tego nie naprawi; uprzedzenie tkwi w modelu kategorii AI
Twoja strategia:
- Testuj PASOR we wszystkich ramowaniach płciowych dla każdego kontekstu sezonowego
- Ustal, które konteksty sezonowe sprzyjają Twojej kategorii
- Planuj główne kampanie wokół korzystnych okien sezonowych
- Rozważ, czy przypisanie kategorii jest trafne (jeśli nie, zgłoś to zespołom AI)
Jeśli działasz w kategorii „kodowanej żeńsko"
Przykłady: biżuteria, artykuły do domu, uroda, wellness, sprzęt kuchenny
Twoja rzeczywistość:
- Silna widoczność w zapytaniach o żonę/córkę/dziewczynę w okresie Świąt
- Możliwa zmniejszona przewaga w Walentynki (odwrócenie sezonowe)
- Słaba lub zerowa widoczność w zapytaniach o męża/syna/chłopaka
Twoje ryzyko:
- Oddanie 40-50% rynku konkurentom, którzy rozwiązali problem kategorii
- Niewidoczność dla kupujących mężczyzn, którzy chcą kupić Twój produkt dla siebie
Twoja strategia:
- Sprawdź, czy Twój produkt jest naprawdę specyficzny płciowo, czy tylko tak skategoryzowany
- Jeśli produkt jest neutralny, lecz zablokowany kategorią, twórz treści łączące kategorie
- Monitoruj przesunięcia sezonowe; Twoja walentynkowa przewaga może nie utrzymać się przez cały rok
Jeśli jesteś zależny od platformy
Przykłady: Ray-Ban, Samsung, Google (wyłącznie wystąpienia czasowe), Tiffany (tylko Walentynki)
Twoja rzeczywistość:
- Niewidoczność w standardowych zapytaniach z ramowaniem płciowym
- Pojawianie się tylko w kontekstach czasowych lub sezonowych
- Możliwe wykluczenie z danych treningowych LLM lub spadek poniżej progów rekomendacji
Twoja strategia:
- Zbadaj, dlaczego nie ma Cię w standardowych rekomendacjach
- Zwiększ liczbę wzmianek o marce w kontekstach wykorzystywanych przez AI do treningu
- Sprawdź, czy inne struktury zapytań otwierają widoczność
Jeśli osiągasz zrównoważony PASOR (jak Apple)
Marki zrównoważone: Apple, Sony, Bose, LEGO, Patagonia, Nintendo
Twoja rzeczywistość:
- Spójne pojawianie się we wszystkich ramowaniach płciowych (zmienność ±10-15%)
- Utrzymanie widoczności w różnych kontekstach sezonowych
- Brak przypisania do konkretnej kategorii demograficznej
Twoja przewaga:
- Maksymalny zasięg rekomendacji we wszystkich typach zapytań
- Niższe ryzyko wahań sezonowych
- Lepsza ochrona przed kontrolą dostępu do kategorii
Twoja strategia:
- Utrzymuj zrównoważone pozycjonowanie we wszystkich treściach
- Monitoruj dryf kategorii, który mógłby przypisać Cię do jednej grupy demograficznej
- Wykorzystaj zrównoważony status jako przewagę konkurencyjną
Walidacja akademicka: recenzja naukowa ma znaczenie
To badanie zostało złożone do czasopisma Human-Centric Intelligent Systems wydawnictwa Springer, recenzowanej publikacji naukowej z dziedziny AI i interakcji człowiek-komputer.
Dlaczego to ważne:
-
Niezależna recenzja: trzech anonimowych ekspertów w dziedzinie badań nad uprzedzeniami AI zweryfikuje metodologię, rygor statystyczny i wnioski przed publikacją.
-
Odtwarzalność: pełna metodologia, testy statystyczne i siła efektu są udokumentowane. Inni badacze mogą powtórzyć wyniki.
-
Trwałość cytowań: po publikacji to badanie stanie się częścią trwałego dorobku naukowego o uprzedzeniach AI, cytowanego w przyszłych pracach.
-
Wiarygodność w branży: walidacja akademicka ma znaczenie dla klientów korporacyjnych, regulatorów i mediów.
Pakiet zgłoszeniowy obejmuje:
- Pełną pracę (30 stron, przeanalizowano 1,279 obserwacji)
- Aneks statystyczny ze wszystkimi ośmioma testami walidacyjnymi
- Oświadczenie o dostępności danych źródłowych
- Oświadczenie o konflikcie interesów (badanie finansowane przez Rankfor.AI, autor jest założycielem)
Obecny status: w trakcie recenzji (złożono w lutym 2026). Spodziewana decyzja: kwiecień-maj 2026.
Jeśli prezentujesz to badanie kadrze zarządzającej, regulatorom lub dziennikarzom, możesz je cytować jako „w trakcie recenzji w Springer Human-Centric Intelligent Systems". Po przyjęciu stanie się cytowalną literaturą naukową.
Konsekwencje dla badań nad uczciwością AI
To badanie wnosi wkład do szerszej literatury o uczciwości AI na trzy sposoby:
1. Modulacja uprzedzenia zależna od kontekstu
Wcześniejsze prace nad uprzedzeniami AI zakładają, że uprzedzenie jest statyczne; jeśli model jest uprzedzony, stosuje to uprzedzenie konsekwentnie. Nasze wyniki dowodzą, że dla rekomendacji LLM to założenie jest błędne.
Kluczowy wkład: uprzedzenie płciowe w komercyjnym AI nie jest stałym parametrem. Modulują je kontekst sezonowy, typ odbiorcy i ramowanie relacji. Audyty uczciwości, które testują tylko jeden kontekst, przeoczą odwrócenia w innych kontekstach.
2. Wyzwania uczenia w otwartym świecie
LLM działają w środowiskach otwartego świata, w których zapytania użytkowników obejmują nieograniczone konteksty demograficzne i sezonowe. Tradycyjne wykrywanie uprzedzeń w zamkniętym świecie (testowanie na stałych zbiorach danych) nie jest w stanie uchwycić tej złożoności.
Kluczowy wkład: pokazujemy, że uprzedzenie LLM przejawia się różnie w kontekstach sezonowych, które w danych treningowych były prawdopodobnie niedoreprezentowane. Odpowiada to badaniom nad uczeniem w otwartym świecie, dotyczącym tego, jak modele generalizują poza rozkłady treningowe.
3. Kontrola dostępu do kategorii jako mechanizm uprzedzenia
Większość badań nad uprzedzeniami skupia się na koncentracji stereotypowej (wielokrotne rekomendowanie tych samych kilku opcji). My wskazujemy inny mechanizm.
Kluczowy wkład: AI nie stereotypizuje zapytań skierowanych do kobiet wąskimi zbiorami marek. Wyklucza z rozważań całe kategorie produktów, a następnie równomiernie rozdziela rekomendacje w obrębie dozwolonych kategorii. Tę „kontrolę dostępu do kategorii" trudniej wykryć, bo metryki różnorodności (entropia Shannona, współczynnik Giniego) wyglądają normalnie.
Co powinieneś teraz zrobić
1. Przeprowadź wielosezonowy audyt PASOR
Przetestuj swoją markę pod kątem:
- Wszystkich ramowań płciowych (mąż/żona/chłopak/dziewczyna/partner)
- Wszystkich kontekstów sezonowych (Święta, Walentynki, Dzień Matki/Ojca, urodziny)
- Wszystkich trzech głównych platform (Gemini, GPT, Grok)
Zmierz PASOR dla każdej kombinacji. Ustal, gdzie jesteś widoczny, gdzie zablokowany i czy dotyczą Cię odwrócenia sezonowe.
2. Sprawdź przypisanie swojej kategorii
Jeśli jesteś przypisany do jednej płci, a Twój produkt jest naprawdę neutralny płciowo, zbadaj:
- Z jakimi kategoriami produktów AI kojarzy Twoją markę?
- Czy te kategorie są w odpowiedziach AI kodowane jako męskie, czy żeńskie?
- Czy możesz połączyć kategorie treściami, które przekraczają granice demograficzne?
3. Monitoruj migrację marki
Nasze badanie dowodzi, że kategoryzacja płciowa nie jest statyczna. Marki przesuwają się między badaniami. Wprowadź testowanie kwartalne, by wykryć zmianę swojego statusu.
4. Segmentuj swoje metryki widoczności
Ogólny PASOR ukrywa luki płciowe. Zawsze raportuj:
- PASOR dla ramowania męskiego (mąż/syn/chłopak)
- PASOR dla ramowania żeńskiego (żona/córka/dziewczyna)
- PASOR dla ramowania neutralnego (partner/dziecko)
- Lukę między męskim a żeńskim (liczy się bardziej niż średnia)
5. Dostosuj strategię do sezonu
Jeśli odkryjesz odwrócenia sezonowe (jak przejście od Świąt do Walentynek), zaplanuj kampanie odpowiednio:
- Wzmacniaj przekaz skierowany do kobiet w sezonach, gdy zapytania żeńskie otrzymują więcej marek
- Wzmacniaj przekaz skierowany do mężczyzn w sezonach, gdy dominują zapytania męskie
- Testuj nowe konteksty sezonowe (Prime Day, Black Friday, powrót do szkoły)
Sprawdź, czy Twoja marka jest przypisana do jednej płci
Zbudowaliśmy darmowe narzędzie, które przeprowadza Twoją markę przez tę samą analizę, której użyliśmy w tym badaniu.
Co zobaczysz:
- Wyniki PASOR we wszystkich ramowaniach płciowych
- Które konteksty sezonowe sprzyjają Twojej marce
- Jak Twoja widoczność wypada na Gemini, GPT i Grok
- Czy jesteś zablokowany kategorią jak Kindle, czy zrównoważony jak Apple
Trzy zapytania. Trzy platformy. Trzy konteksty sezonowe. Natychmiastowa analiza PASOR.
Bez podawania e-maila. Zajmuje 90 sekund.
Sprawdź status przypisania płciowego swojej marki
Podsumowanie metodologii
- Łączna liczba zapytań: 1,279 (299 + 480 + 500 w trzech badaniach)
- Testowane platformy: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
- Zapytania na badanie:
- Badanie 1: 4 warunki (mąż/żona/partner/2025)
- Badanie 2: 4 warunki (syn/córka/dziecko/2026)
- Badanie 3: 5 warunków (mąż/żona/chłopak/dziewczyna/partner)
- Temperatura: 0.7 (Badania 2-3), domyślna (Badanie 1)
- Zbieranie danych: grudzień 2025 - luty 2026
- Walidacja statystyczna: testy chi-kwadrat, d Cohena, V Craméra, entropia Shannona, współczynnik Giniego, indeks Jaccarda, bootstrapowe przedziały ufności
- Siła efektu: średnia do dużej (V Craméra = 0.23-0.38, d Cohena = 0.82-1.24)
- Recenzja naukowa: złożono do Springer Human-Centric Intelligent Systems, luty 2026
Pełny aneks statystyczny i dane źródłowe dostępne na życzenie. W sprawie współpracy naukowej pisz na research@rankfor.ai.
Powiązane badania
Kindle: 100% zapytań o żonę. 0% zapytań o męża. To samo AI.
Nasze pierwsze odkrycie (grudzień 2025, n=299), które zidentyfikowało zjawisko Kindle i stworzyło statystyczny fundament dla uprzedzenia płciowego w rekomendacjach LLM. To badanie stało się Badaniem 1 w analizie trzech badań.
Kluczowy wynik: o 41% mniej marek dla zapytań o żonę. Chi-kwadrat 137.32, p<0.001.
Tylko 2 marki są widoczne na wszystkich platformach AI. Czy Twoja jest jedną z nich?
Badanie z dziećmi jako odbiorcami (styczeń 2026, n=480), które dowiodło, że uprzedzenie płciowe wykracza poza konteksty dorosłych, i wykazało, że uniwersalna widoczność jest niemal nieosiągalna. To badanie stało się Badaniem 2 w analizie trzech badań.
Kluczowy wynik: tylko LEGO i Disney osiągają uniwersalną widoczność na wielu platformach. O 28% mniej marek dla zapytań o córkę.
Badanie przeprowadził Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Złożone do Springer Human-Centric Intelligent Systems, luty 2026. Pełna praca, aneks statystyczny i dane źródłowe dostępne na życzenie.
Kluczowe pojęcia
PASOR (Prompt-Adjusted Share of Recommendation): odsetek trafnych zapytań, w których Twoja marka pojawia się w odpowiedziach AI. W odróżnieniu od tradycyjnych rankingów PASOR mierzy sam fakt obecności marki w odpowiedzi, w oderwaniu od jej pozycji.
Kontrola dostępu do kategorii (category gatekeeping): sytuacja, w której AI wyklucza całe kategorie produktów z zapytań przypisanych do danej płci, blokując im dostęp do rekomendacji. Analiza entropii Shannona wskazała to jako główny mechanizm uprzedzenia.
Marka przypisana do jednej płci (gender-locked): marka, która pojawia się wyłącznie w jednym ramowaniu płciowym (np. tylko w zapytaniach o męża) i nigdy w pozostałych. W trzech badaniach zidentyfikowaliśmy 69 takich marek.
Sezonowe odwrócenie uprzedzenia: sytuacja, w której kierunek uprzedzenia płciowego zmienia się wraz z kontekstem sezonowym. Święta zmniejszają liczbę rekomendacji dla ramowania żeńskiego o 28-61%, podczas gdy Walentynki zwiększają ją o 8.8% (Gemini).
Zgodność między modelami (indeks Jaccarda): odsetek marek rekomendowanych przez wiele platform AI dla tego samego zapytania. Niska zgodność (10-45% w naszych badaniach) oznacza widoczność zależną od platformy.
V Craméra: miara siły związku dla testów chi-kwadrat, w zakresie od 0 (brak związku) do 1 (związek doskonały). Wartości 0.23-0.38 wskazują na średni do dużego związek między płcią a kategorią w naszych badaniach.
d Cohena: wystandaryzowana miara różnicy między dwiema grupami. Wartości 0.82-1.24 wskazują na duże praktyczne różnice w liczbie marek między ramowaniami płciowymi.
Migracja marki: sytuacja, w której kategoryzacja płciowa marki zmienia się między okresami pomiaru. Theragun, Peloton i Oura przeszły od przypisania do jednej płci do neutralności między badaniami.
