research

Quando a IA muda de ideia sobre gênero: três estudos provam que o viés é real, sistemático e sazonal

February 15, 2026
20 min read
n=929
Dmitrij Żatuchin
Gender BiasAI ResearchLLM RecommendationsSeasonal BiasCategory GatekeepingPASORGeminiGPT

Realizamos 1,279 consultas em três plataformas de IA e duas temporadas de presentes. O resultado: prova estatística definitiva de que a IA trata marcas de forma diferente conforme o gênero, e de que o viés muda de direção dependendo se você pergunta durante o Natal ou o Dia dos Namorados.


A descoberta que encerrou o debate

Há um ano, documentamos o viés de gênero nas recomendações de marcas feitas por IA. Primeiro, encontramos o fenômeno Kindle: 100% de visibilidade para consultas sobre esposas, 0% para consultas sobre maridos. Depois, ampliamos para presentes destinados a crianças e constatamos que o viés persistia: 28% menos marcas para filhas do que para filhos.

Alguns argumentaram que eram achados isolados. Peculiaridades das plataformas. Variação aleatória. Ruído estatístico.

Esta pesquisa encerra esse argumento.

1,279 consultas. Três estudos complementares. Dois contextos sazonais. Uma conclusão: o viés de gênero nas recomendações de IA é sistemático, comprovado estatisticamente e dependente do contexto.

O artigo, submetido à revista Human-Centric Intelligent Systems da Springer, fornece validação acadêmica formal do que observamos pela primeira vez em testes no mundo real. A evidência estatística já não é discutível.


O desenho dos três estudos: por que esta pesquisa é definitiva

A maioria das pesquisas sobre viés testa um único cenário e considera o trabalho concluído. Desenhamos três estudos interligados para eliminar toda explicação alternativa:

Estudo 1: Presentes de Natal para adultos (dezembro de 2025, n=299)

Prompts testados: marido/esposa/parceiro(a)/presente 2025 Principal achado: 41% menos marcas para consultas sobre esposas no Gemini Prova estatística: χ² = 137.32, p < 0.001

Estudo 2: Presentes de Natal para crianças (janeiro de 2026, n=480)

Prompts testados: filho/filha/criança/presente 2026 Principal achado: 28% menos marcas para consultas sobre filhas em todas as plataformas Prova estatística: χ² = 524.32, p < 0.001 (quase 4x mais forte que o Estudo 1)

Estudo 3: Presentes de Dia dos Namorados para parceiros (fevereiro de 2026, n=500)

Prompts testados: marido/esposa/namorado/namorada/parceiro(a) Principal achado: REVERSÃO sazonal; prompts com enquadramento feminino recebem 8.8% MAIS marcas no Gemini Prova estatística: χ² = 89.45, p < 0.001

Análise combinada: 1,279 observações independentes em 12 condições de prompt e 3 plataformas de IA.

Três estudos: tamanho da amostra e lacuna de gênero por estudo

299480500-41-288.8Estudo 1: Adultos no NatalEstudo 2: Crianças no NatalEstudo 3: Dia dos Namorados0100200300400500
Tamanho da amostraLacuna de marcas femininas (%)

A validação estatística é contundente. Valores de Cramér's V entre 0.23 e 0.38 indicam tamanhos de efeito médios a grandes. Intervalos de confiança por bootstrap confirmam que os efeitos são fortes. Isto é viés sistemático, não variação aleatória.


A reversão que mudou tudo

Eis o achado que transforma a forma como entendemos o viés da IA:

Enquadramento de Natal: a IA recomenda de 28% a 61% menos marcas para consultas voltadas ao público feminino Enquadramento de Dia dos Namorados: a IA recomenda 8.8% MAIS marcas para consultas voltadas ao público feminino no Gemini

A mesma IA. O mesmo universo de marcas. Estação diferente. Direção de viés oposta.

PlataformaLacuna esposa (Natal)Lacuna esposa (Dia dos Namorados)Mudança sazonal
Gemini-41% marcas+8.8% marcas49.8% de reversão
GPT-15% marcas+12.1% marcas27.1% de reversão
Grok-35% marcas-2.3% marcas32.7% de reversão

Reversão sazonal do viés: Natal vs Dia dos Namorados

-41-15-358.812.1-2.3GeminiGPTGrok−40−30−20−10010
Lacuna esposa no Natal (%)Lacuna esposa no Dia dos Namorados (%)

Esta descoberta prova três pontos essenciais:

  1. O viés depende do contexto. A mesma estrutura de consulta produz resultados opostos em contextos sazonais diferentes.
  2. A IA aprendeu padrões culturais. O Dia dos Namorados é codificado como voltado ao feminino nos dados de treinamento, revertendo o viés masculino padrão.
  3. Medições em um único ponto não têm valor. Sua marca pode dominar um contexto sazonal enquanto fica invisível em outro.

O termo acadêmico para isso é "modulação de viés dependente do contexto". Em termos práticos: sua estratégia de visibilidade em IA precisa considerar a sazonalidade, caso contrário você está medindo metade do quadro.


69 marcas travadas por gênero: a lista completa

Ao longo dos três estudos, identificamos 69 marcas que aparecem exclusivamente em um enquadramento de gênero:

Marcas travadas no masculino (48 no total):

  • Tecnologia/Gadgets: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
  • Ferramentas: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
  • Ar livre: Traeger, Weber, Osprey, North Face, Patagonia (parcial)
  • Cuidados pessoais: Dollar Shave Club, Manscaped
  • Relógios: Rolex, Omega, Seiko, Tissot
  • Esportes: Titleist, Under Armour, Theragun (apenas no Natal)

Marcas travadas no feminino (17 no total):

  • Casa: Stanley, KitchenAid, Vitamix, Breville, Our Place
  • Beleza: Glossier, Kate Spade
  • Bem-estar: Oura (apenas no Natal), Peloton (apenas no Natal)
  • Leitura: Kindle (dominante no Natal, neutra no Dia dos Namorados)
  • Joias: Tiffany (apenas no Dia dos Namorados)

Travas específicas de plataforma (4 marcas):

  • Ray-Ban, LG, Google, Samsung aparecem apenas em consultas temporais/neutras

Nota do estudo: algumas marcas mudaram de categoria entre os estudos. A Theragun estava travada no masculino no Estudo 1, porém neutra no Estudo 3. O Kindle passou de 100% travado nas esposas para dependente da estação. A categorização de gênero feita pela IA não é estática.

Se sua marca está nesta lista, você fica invisível para metade do seu mercado potencial dependendo de como a pergunta é formulada. Nenhuma otimização de conteúdo resolverá isso: o viés existe no modelo de categorias da IA, não na sua mensagem.


O mecanismo: controle de acesso por categoria

Testamos duas hipóteses concorrentes sobre como a IA cria viés de gênero:

Hipótese 1: Concentração estereotipada A IA recomenda repetidamente as mesmas poucas marcas estereotipadas para consultas femininas (baixa diversidade).

Hipótese 2: Controle de acesso por categoria A IA exclui categorias inteiras de produtos das consultas femininas, mas distribui as recomendações de forma uniforme dentro das categorias permitidas (alta diversidade, porém um conjunto menor).

A análise de entropia de Shannon provou que a Hipótese 2 está correta.

Consultas voltadas ao feminino pontuam de 0.86 a 0.88 na entropia de Shannon (quase idêntico às consultas masculinas). Os coeficientes de Gini são, na verdade, MAIS BAIXOS para consultas femininas (0.30-0.48) do que para masculinas (0.41-0.57), o que indica uma distribuição mais uniforme entre as marcas recomendadas.

A IA está sendo excludente, não estereotipada.

O controle de acesso por categoria significa que a IA decide quais categorias de produto são "apropriadas" para cada gênero e, em seguida, exclui conjuntos inteiros de marcas da análise. Uma marca em uma categoria "codificada como masculina" nunca chega a entrar no conjunto de recomendações para consultas femininas.

Isso é pior do que o estereótipo. O estereótipo ao menos manteria sua marca visível (mesmo que posicionada de forma incorreta). O controle de acesso torna sua marca invisível para padrões inteiros de consulta.

Como o controle de acesso funciona na prática

Quando alguém pergunta "Qual é o melhor presente para minha esposa?", a IA não pesquisa todas as marcas para escolher as estereotipadas. Em vez disso:

  1. A IA identifica categorias de produto "apropriadas para o feminino": joias, artigos para casa, bem-estar, beleza, leitura
  2. A IA busca recomendações de marcas SOMENTE nessas categorias
  3. Marcas em categorias "codificadas como masculinas" (ferramentas, gadgets de tecnologia, equipamentos para ar livre, relógios) são excluídas da análise
  4. As recomendações são distribuídas de forma uniforme entre as categorias permitidas

O mesmo processo ocorre de forma inversa para consultas sobre maridos, só que com um conjunto maior de categorias permitidas (daí a contagem de marcas mais alta).

É por isso que o Kindle aparece para consultas sobre esposas e não sobre maridos. O e-reader da Amazon pertence ao agrupamento de categorias "leitura/casa", que a IA codificou como apropriado para o feminino. O produto é neutro em relação ao gênero. A atribuição de categoria não é.


Concordância entre modelos: ainda péssima

Apesar de analisarmos 1,279 consultas, as plataformas de IA ainda não conseguem concordar sobre quais marcas recomendar:

EstudoSobreposição Gemini-GPTSobreposição Gemini-GrokSobreposição GPT-Grok
Estudo 1 (adultos no Natal)14% (Jaccard 0.08)45% (Jaccard 0.38)28% (Jaccard 0.17)
Estudo 2 (crianças no Natal)10% (Jaccard 0.10)42% (Jaccard 0.35)25% (Jaccard 0.20)
Estudo 3 (Dia dos Namorados)18% (Jaccard 0.12)51% (Jaccard 0.45)33% (Jaccard 0.25)

Concordância entre modelos (Índice de Jaccard) nos estudos

0.080.10.120.380.350.450.170.20.25Estudo 1Estudo 2Estudo 300.10.20.30.4
Gemini-GPTGemini-GrokGPT-Grok

Concordância média entre modelos: 20-35%.

Tradução: se você mede sua visibilidade em IA em apenas uma plataforma, está vendo de 20% a 35% da realidade. Os outros 65% a 80% das recomendações de marca são completamente diferentes nas plataformas concorrentes.

As personalidades das plataformas permanecem consistentes

As três plataformas mantêm "personalidades" distintas ao longo de todos os estudos:

GPT-5.2: o minimalista de marcas

  • Média de 0.1 a 4.7 marcas por resposta (a mais baixa entre todos os estudos)
  • Muitas vezes recomenda zero marcas específicas, preferindo categorias ("considere um smartwatch")
  • A abstinência deliberada de marcas é uma escolha estratégica, não uma limitação de capacidade

Gemini: o maximalista de marcas

  • Média de 3.7 a 11.9 marcas por resposta (a mais alta entre todos os estudos)
  • Cita de forma consistente de 4 a 12 marcas específicas por resposta
  • O mais suscetível aos efeitos de viés de gênero (as maiores lacunas entre consultas masculinas/femininas)

Grok: o meio-termo eficiente

  • Média de 2.5 a 10.0 marcas por resposta
  • A maior densidade de marcas por caractere (o mais focado em produtos)
  • O mais estável entre os enquadramentos de gênero (as menores lacunas)

Se você está otimizando a visibilidade em IA sem testar as três plataformas, está otimizando para uma personalidade enquanto ignora as outras duas.


A métrica PASOR: medir o que realmente importa

Métricas tradicionais como "impressões" ou "rankings" não se aplicam às recomendações de IA. Ou você está incluído na resposta, ou você fica invisível. Não existe posição 1 contra posição 10.

Apresentamos a métrica Prompt-Adjusted Share of Recommendation (PASOR):

PASOR = (Your brand's appearance count / Total relevant queries) × 100

Exemplo: Kindle no Estudo 1 (adultos no Natal)

  • Consultas sobre esposas: 100% de PASOR (39 aparições / 39 consultas sobre esposas)
  • Consultas sobre parceiros(as): 100% de PASOR (30 aparições / 30 consultas sobre parceiros(as))
  • Consultas sobre maridos: 0% de PASOR (0 aparições / 40 consultas sobre maridos)
  • PASOR geral: 63.4% (69 aparições / 109 consultas no total)

Mas eis o problema: o PASOR geral mascara as lacunas de gênero. Se você mede apenas sua pontuação agregada, deixa de perceber que domina um grupo demográfico enquanto fica invisível para outro.

O PASOR segmentado por gênero revela a verdade:

  • PASOR com enquadramento masculino: 0%
  • PASOR com enquadramento feminino: 100%
  • Lacuna: 100 pontos percentuais

Para marcas que buscam visibilidade equilibrada, a lacuna importa mais do que a média.

PASOR na prática: a reversão do Dia dos Namorados

PASOR do Estudo 3 para marcas selecionadas:

MarcaPASOR maridoPASOR esposaPASOR namoradoPASOR namoradaLacuna
Tiffany0%73%0%80%-73pp
Apple67%60%70%57%+7pp (equilibrado)
LEGO33%20%37%23%+13pp
Kindle27%40%23%43%-13pp (neutro no Dia dos Namorados vs extremo no Natal)

A Apple alcança um PASOR quase universal (57-70% em todos os enquadramentos). A Tiffany está completamente travada nos prompts femininos. A lacuna de gênero do Kindle diminuiu de 100 pontos percentuais no Estudo 1 para 13-17 pontos no Estudo 3, o que prova que as atribuições de categoria podem mudar conforme a estação.


A evidência estatística: além de qualquer dúvida

Para os leitores que questionam se esses efeitos são reais ou apenas ruído de medição, eis a validação estatística formal:

Testes qui-quadrado (independência categoria-gênero)

EstudoValor de χ²valor de pCramér's VTamanho de efeitoInterpretação
Estudo 1137.32<0.0010.23MédioRejeita a independência
Estudo 2524.32<0.0010.38Médio-GrandeRejeita a independência
Estudo 389.45<0.0010.26MédioRejeita a independência

Tradução: há menos de 0.1% de chance de esses padrões serem aleatórios. As categorias de produto e o enquadramento de gênero estão sistematicamente ligados.

Tamanhos de efeito (lacunas na contagem de marcas)

ComparaçãoCohen's dIC 95%Tamanho de efeitoSignificado prático
Estudo 1: marido vs esposa (Gemini)1.24[0.89, 1.59]Grande41% menos marcas
Estudo 2: filho vs filha (todos os modelos)0.82[0.61, 1.03]Grande28% menos marcas
Estudo 3: REVERSÃO da esposa no Dia dos Namorados-0.31[-0.58, -0.04]Pequeno8.8% MAIS marcas

Os tamanhos de efeito são apresentados com intervalos de confiança por bootstrap (10,000 reamostragens). Todos os efeitos são robustos à variação de amostragem.

Validação cruzada

Validamos os achados usando oito testes estatísticos independentes:

  1. Testes qui-quadrado (associação categoria-gênero)
  2. Cohen's d (diferenças na contagem de marcas)
  3. Entropia de Shannon (diversidade dentro dos grupos de gênero)
  4. Coeficiente de Gini (concentração/desigualdade)
  5. Índice de Jaccard (sobreposição entre modelos)
  6. Cramér's V (tamanho de efeito para o qui-quadrado)
  7. Intervalos de confiança por bootstrap (verificação de robustez)
  8. Análise de migração de marcas (estabilidade temporal)

Todos os oito métodos convergem para a mesma conclusão: o viés de gênero é sistemático, dependente da plataforma e dependente do contexto.

Could not load chart data

O que mudou entre os estudos: padrões de migração de marcas

Algumas marcas mantiveram uma categorização de gênero consistente nos três estudos. Outras mudaram:

Travas de gênero estáveis:

  • Travadas no masculino em todos os estudos: Garmin, DeWalt, Milwaukee, Rolex, Omega
  • Travadas no feminino em todos os estudos: Stanley, KitchenAid, Glossier

Categorização alterada:

  • Theragun: travada no masculino (Estudo 1) → neutra (Estudo 3)
  • Peloton: travada no masculino (Estudo 1) → neutra (Estudo 3)
  • Kindle: 100% travada no feminino (Estudo 1) → dependente da estação (Estudo 3, ainda com lacuna de 13-17pp)
  • Oura: travada no feminino (Estudo 1) → neutra (Estudo 3)

Aparição apenas sazonal:

  • Tiffany, Cartier: invisíveis nos estudos de Natal, travadas no feminino no estudo do Dia dos Namorados
  • Ray-Ban, LG: apenas em consultas temporais, nunca com enquadramento de gênero

Conclusão principal: a categorização de gênero da IA evolui. Uma marca que estava travada por gênero no trimestre passado pode ter mudado. Testes regulares são a única forma de saber seu status atual.


Por que "parceiro(a)" e "criança" não são neutros em relação ao gênero

Testamos linguagem neutra em relação ao gênero nos três estudos. Os resultados provam que a neutralidade é uma ilusão.

Estudo 1: "parceiro(a)" = padrão de esposa

  • Consultas sobre parceiros(as) compartilham 69.2% das marcas com consultas sobre esposas
  • Consultas sobre parceiros(as) compartilham 37.5% das marcas com consultas sobre maridos
  • "Parceiro(a)" não é neutro; por padrão, assume o enquadramento feminino.

Estudo 2: "criança" = padrão de filha

  • Consultas sobre crianças compartilham 56.2% das marcas com consultas sobre filhas
  • Consultas sobre crianças compartilham 42.6% das marcas com consultas sobre filhos
  • "Criança" não é neutro; por padrão, assume o enquadramento feminino.

Estudo 3: "parceiro(a)" = padrão de esposa (novamente)

  • Consultas sobre parceiros(as) compartilham 64.8% das marcas com consultas sobre esposas
  • Consultas sobre parceiros(as) compartilham 41.3% das marcas com consultas sobre maridos
  • O padrão persiste entre os contextos sazonais.

Se a estratégia da sua marca se apoia em um posicionamento "inclusivo" ou "neutro em relação ao gênero", você pode estar otimizando para a visibilidade de enquadramento feminino e deixando de fora, por completo, as recomendações de enquadramento masculino. A IA interpreta a neutralidade como feminina por padrão.


A dependência do contexto sazonal: Natal vs Dia dos Namorados

Este é o achado que muda de forma fundamental como entendemos o viés da IA.

Hipótese testada: o mesmo enquadramento de gênero produz um viés consistente em diferentes contextos sazonais?

Resposta: não. A direção do viés se inverte.

MétricaNatal (Estudos 1 e 2)Dia dos Namorados (Estudo 3)Mudança
Lacuna esposa vs marido no Gemini-41% marcas+8.8% marcas49.8pp de reversão
Marcas travadas no feminino17 marcas12 marcas (mas um conjunto diferente)-29%
Marcas travadas no masculino48 marcas22 marcas (mas um conjunto diferente)-54%
Equilíbrio de PASOR neutro em gêneroEnviesado para o femininoMais equilibradoMelhorou

Por que isso acontece: os dados de treinamento da IA codificam padrões culturais. A troca de presentes de Natal tem, tradicionalmente, um enquadramento masculino na cultura ocidental (maridos compram presentes para as esposas, pais compram para os filhos). O Dia dos Namorados tem enquadramento feminino (namorados compram para as namoradas, maridos para as esposas).

A IA aplica padrões aprendidos, específicos de cada contexto, a partir dos dados de treinamento, não um viés de gênero universal.

Isso explica por que as medições em um único ponto induzem ao erro. Uma marca que domina as recomendações de Natal pode ficar invisível durante o Dia dos Namorados, ou vice-versa. Testar por estação é obrigatório para uma avaliação completa de visibilidade.


O que isso significa para a sua marca

Se você está em uma categoria "codificada como masculina"

Exemplos: ferramentas, gadgets de tecnologia, equipamentos para ar livre, equipamentos esportivos, relógios de luxo

Sua realidade:

  • Forte visibilidade em consultas sobre marido/filho/namorado
  • Visibilidade fraca ou nula em consultas sobre esposa/filha/namorada durante o Natal
  • Pode melhorar a visibilidade em consultas de enquadramento feminino durante o Dia dos Namorados (depende da plataforma)

Seu risco:

  • Perder de 40% a 50% do mercado potencial durante as temporadas de presentes de alto volume
  • A otimização de conteúdo não resolverá isso: o viés está no modelo de categorias da IA

Sua estratégia:

  1. Teste o PASOR em todos os enquadramentos de gênero para cada contexto sazonal
  2. Identifique quais contextos sazonais favorecem sua categoria
  3. Programe as grandes campanhas em torno das janelas sazonais favoráveis
  4. Avalie se a atribuição da sua categoria está correta (recorra às equipes de IA se não estiver)

Se você está em uma categoria "codificada como feminina"

Exemplos: joias, artigos para casa, beleza, bem-estar, eletrodomésticos de cozinha

Sua realidade:

  • Forte visibilidade em consultas sobre esposa/filha/namorada durante o Natal
  • Pode ter uma vantagem reduzida durante o Dia dos Namorados (reversão sazonal)
  • Visibilidade fraca ou nula em consultas sobre marido/filho/namorado

Seu risco:

  • Deixar de 40% a 50% do mercado para concorrentes que resolveram o problema de categoria
  • Ficar invisível para homens que dão presentes e querem comprar seu produto para si mesmos

Sua estratégia:

  1. Teste se seu produto é realmente específico de gênero ou apenas categorizado por gênero
  2. Se o produto é neutro, mas está travado por categoria, crie conteúdo que conecte categorias
  3. Acompanhe as mudanças sazonais: sua vantagem no Dia dos Namorados pode não persistir o ano todo

Se você é específico de plataforma

Exemplos: Ray-Ban, Samsung, Google (aparição apenas temporal), Tiffany (apenas no Dia dos Namorados)

Sua realidade:

  • Invisível em consultas padrão com enquadramento de gênero
  • Aparece apenas em contextos temporais ou específicos de uma estação
  • Pode estar excluído dos dados de treinamento do LLM ou ficar abaixo dos limiares de recomendação

Sua estratégia:

  1. Investigue por que você está ausente das recomendações padrão
  2. Aumente as menções à marca nos contextos que a IA usa para treinamento
  3. Teste se estruturas de consulta diferentes liberam visibilidade

Se você alcança um PASOR equilibrado (como a Apple)

Marcas equilibradas: Apple, Sony, Bose, LEGO, Patagonia, Nintendo

Sua realidade:

  • Aparece de forma consistente entre os enquadramentos de gênero (variação de ±10-15%)
  • Mantém visibilidade entre os contextos sazonais
  • Não está travado em nenhuma categoria demográfica específica

Sua vantagem:

  • Alcance máximo de recomendação em todos os tipos de consulta
  • Menor risco de volatilidade sazonal
  • Mais protegido do controle de acesso por categoria

Sua estratégia:

  1. Mantenha um posicionamento equilibrado em todo o conteúdo
  2. Monitore o desvio de categoria que poderia travar você em um único grupo demográfico
  3. Use seu status equilibrado como vantagem competitiva

A validação acadêmica: a revisão por pares importa

Esta pesquisa foi submetida à revista Human-Centric Intelligent Systems da Springer, uma publicação acadêmica com revisão por pares na área de IA e interação humano-computador.

Por que isso importa:

  1. Revisão independente: três especialistas anônimos em pesquisa de viés de IA vão validar a metodologia, o rigor estatístico e as conclusões antes da publicação.

  2. Reprodutibilidade: a metodologia completa, os testes estatísticos e os tamanhos de efeito estão documentados. Outros pesquisadores podem replicar os achados.

  3. Permanência da citação: uma vez publicada, esta pesquisa passa a fazer parte do registro acadêmico permanente sobre viés de IA, citada por estudos futuros.

  4. Credibilidade no setor: a validação acadêmica tem peso junto a compradores corporativos, reguladores e imprensa.

O pacote de submissão inclui:

  • Artigo completo (30 páginas, 1,279 observações analisadas)
  • Apêndice estatístico com todos os oito testes de validação
  • Declaração de disponibilidade dos dados brutos
  • Declaração de conflito de interesses (pesquisa financiada pela Rankfor.AI, autor é o fundador)

Status atual: em revisão (submetido em fevereiro de 2026). Decisão prevista: abril-maio de 2026.

Se você está apresentando esta pesquisa a executivos, reguladores ou jornalistas, pode citá-la como "em revisão por pares na Springer Human-Centric Intelligent Systems". Uma vez aceita, torna-se literatura acadêmica passível de citação.


As implicações para a pesquisa de justiça em IA

Esta pesquisa contribui para a literatura mais ampla de justiça em IA de três formas:

1. Modulação de viés dependente do contexto

Os trabalhos anteriores sobre viés de IA pressupõem que o viés é estático: se um modelo é enviesado, aplica esse viés de forma consistente. Nossos achados provam que isso está errado para as recomendações de LLM.

Contribuição principal: o viés de gênero na IA comercial é um parâmetro variável, modulado pelo contexto sazonal, pelo tipo de destinatário e pelo enquadramento da relação. Auditorias de justiça que testam apenas um contexto vão deixar passar reversões em outros contextos.

2. Desafios do aprendizado em mundo aberto

Os LLMs operam em ambientes de mundo aberto, nos quais as consultas dos usuários percorrem contextos demográficos e sazonais ilimitados. A detecção tradicional de viés em mundo fechado (testes em conjuntos de dados fixos) não consegue capturar essa complexidade.

Contribuição principal: demonstramos que o viés dos LLMs se manifesta de forma diferente entre contextos sazonais que provavelmente estavam sub-representados nos dados de treinamento. Isso está em sintonia com a pesquisa de aprendizado em mundo aberto sobre como os modelos generalizam para além das distribuições de treinamento.

3. Controle de acesso por categoria como mecanismo de viés

A maioria das pesquisas sobre viés foca na concentração estereotipada (recomendar repetidamente as mesmas poucas opções). Identificamos um mecanismo diferente.

Contribuição principal: a IA exclui categorias inteiras de produtos da análise e distribui as recomendações de forma uniforme dentro das categorias permitidas; ela não recorre a estereótipos com conjuntos restritos de marcas nas consultas femininas. Esse "controle de acesso por categoria" é mais difícil de detectar porque as métricas de diversidade (entropia de Shannon, coeficiente de Gini) parecem normais.


O que você deve fazer agora

1. Faça uma auditoria de PASOR multi-sazonal

Teste sua marca em:

  • Todos os enquadramentos de gênero (marido/esposa/namorado/namorada/parceiro(a))
  • Todos os contextos sazonais (Natal, Dia dos Namorados, Dia das Mães/Dia dos Pais, aniversários)
  • As três principais plataformas (Gemini, GPT, Grok)

Meça o PASOR para cada combinação. Identifique onde você está visível, onde está bloqueado e se você enfrenta reversões sazonais.

2. Verifique a atribuição da sua categoria

Se você está travado por gênero, mas seu produto é realmente neutro em relação ao gênero, investigue:

  • A quais categorias de produto a IA associa sua marca?
  • Essas categorias são codificadas como masculinas ou femininas nas respostas da IA?
  • Você consegue conectar categorias por meio de conteúdo que atravessa fronteiras demográficas?

3. Monitore a migração de marcas

Nossa pesquisa prova que a categorização de gênero é dinâmica. As marcas mudam de categoria entre os estudos. Configure testes trimestrais para detectar quando seu status muda.

4. Segmente suas métricas de visibilidade

O PASOR geral esconde lacunas de gênero. Sempre reporte:

  • PASOR de enquadramento masculino (marido/filho/namorado)
  • PASOR de enquadramento feminino (esposa/filha/namorada)
  • PASOR de enquadramento neutro (parceiro(a)/criança)
  • Lacuna entre masculino e feminino (isso importa mais do que a média)

5. Ajuste a estratégia por estação

Se você descobrir reversões sazonais (como a mudança do Natal para o Dia dos Namorados), programe suas campanhas de acordo:

  • Reforce mensagens voltadas ao feminino nas estações em que as consultas de enquadramento feminino recebem mais marcas
  • Reforce mensagens voltadas ao masculino nas estações em que as consultas de enquadramento masculino predominam
  • Teste contextos sazonais emergentes (Prime Day, Black Friday, volta às aulas)

Verifique se sua marca está travada por gênero

Criamos uma ferramenta gratuita que submete sua marca à mesma análise que usamos nesta pesquisa.

O que você vai ver:

  • Pontuações de PASOR em todos os enquadramentos de gênero
  • Quais contextos sazonais favorecem sua marca
  • Como sua visibilidade se compara entre Gemini, GPT e Grok
  • Se você está travado por categoria como o Kindle ou equilibrado como a Apple

Três prompts. Três plataformas. Três contextos sazonais. Análise instantânea de PASOR.

Sem necessidade de e-mail. Leva 90 segundos.

Verifique o status de trava de gênero da sua marca


Resumo da metodologia

  • Total de consultas: 1,279 (299 + 480 + 500 nos três estudos)
  • Plataformas testadas: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
  • Prompts por estudo:
    • Estudo 1: 4 condições (marido/esposa/parceiro(a)/2025)
    • Estudo 2: 4 condições (filho/filha/criança/2026)
    • Estudo 3: 5 condições (marido/esposa/namorado/namorada/parceiro(a))
  • Temperatura: 0.7 (Estudos 2-3), padrão (Estudo 1)
  • Coleta de dados: dezembro de 2025 a fevereiro de 2026
  • Validação estatística: testes qui-quadrado, Cohen's d, Cramér's V, entropia de Shannon, coeficiente de Gini, índice de Jaccard, intervalos de confiança por bootstrap
  • Tamanhos de efeito: médios a grandes (Cramér's V = 0.23-0.38, Cohen's d = 0.82-1.24)
  • Revisão por pares: submetido à Springer Human-Centric Intelligent Systems, fevereiro de 2026

Apêndice estatístico completo e dados brutos disponíveis mediante solicitação. Entre em contato pelo research@rankfor.ai para propostas de colaboração acadêmica.


Pesquisas relacionadas

Kindle: 100% das consultas sobre esposas. 0% das consultas sobre maridos. A mesma IA.

Nossa descoberta original (dezembro de 2025, n=299) que identificou pela primeira vez o fenômeno Kindle e estabeleceu a base estatística para o viés de gênero nas recomendações de LLM. Esta pesquisa se tornou o Estudo 1 na análise dos três estudos.

Principal achado: 41% menos marcas para consultas sobre esposas. Qui-quadrado 137.32, p<0.001.

Apenas 2 marcas são visíveis em todas as plataformas de IA. A sua é uma delas?

O estudo sobre presentes para crianças (janeiro de 2026, n=480) que provou que o viés de gênero se estende para além dos contextos adultos e mostrou que a visibilidade universal é quase impossível de alcançar. Esta pesquisa se tornou o Estudo 2 na análise dos três estudos.

Principal achado: apenas LEGO e Disney alcançam visibilidade universal entre plataformas. 28% menos marcas para consultas sobre filhas.


Pesquisa conduzida por Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Submetida à Springer Human-Centric Intelligent Systems, fevereiro de 2026. Artigo completo, apêndice estatístico e dados brutos disponíveis mediante solicitação.


Termos-chave

PASOR (Prompt-Adjusted Share of Recommendation): o percentual de consultas relevantes em que sua marca aparece nas respostas da IA. Diferentemente dos rankings tradicionais, o PASOR mede inclusão versus exclusão, não posição.

Controle de acesso por categoria: quando a IA exclui categorias inteiras de produtos das consultas específicas de gênero, sem se limitar a estereotipar dentro de um conjunto permitido. Identificado como o principal mecanismo de viés por meio da análise de entropia de Shannon.

Marca travada por gênero: uma marca que aparece exclusivamente em um enquadramento de gênero (por exemplo, apenas em consultas sobre maridos) e nunca em outros. Nossa pesquisa identificou 69 marcas desse tipo nos três estudos.

Reversão sazonal de viés: quando a direção do viés de gênero muda conforme o contexto sazonal. O Natal reduz as recomendações de enquadramento feminino em 28-61%, enquanto o Dia dos Namorados as aumenta em 8.8% (Gemini).

Concordância entre modelos (índice de Jaccard): o percentual de marcas recomendadas por múltiplas plataformas de IA para a mesma consulta. Uma concordância baixa (10-45% em nossos estudos) indica visibilidade dependente da plataforma.

Cramér's V: uma medida da força de associação para testes qui-quadrado, que varia de 0 (nenhuma associação) a 1 (associação perfeita). Valores de 0.23-0.38 indicam associações médias a grandes entre gênero e categoria em nossos estudos.

Cohen's d: uma medida padronizada da diferença entre dois grupos. Valores de 0.82-1.24 indicam grandes diferenças práticas na contagem de marcas entre os enquadramentos de gênero.

Migração de marcas: quando a categorização de gênero de uma marca muda entre os períodos de medição. Theragun, Peloton e Oura passaram de travadas por gênero para neutras entre os estudos.

People Also Ask

Continue Reading

research

70% of AI Gift Recommendations Are Gender-Locked

150 queries on Valentine's Day 2026 across three AI models reveal 70% of brand recommendations are gender-exclusive. Gemini names 11.4 brands per response vs 1.3 for Grok and 1.2 for OpenAI. Only Away and Ember transcend gender silos. Female-framed prompts now get 16.2% more brands than male - the opposite of Christmas.

research

Four-Prompt Gender Bias Analysis: Isolating Gender Effects in LLM Brand Recommendations

This study extends cross-prompt LLM brand consistency analysis by introducing a gender-neutral "partner" prompt to isolate gender bias effects. Comparing four prompt variations across 299 total samples, we provide strong evidence of gender-based brand recommendation bias in LLMs. Critical finding: Kindle appeared in 100% of wife AND partner iterations but 0% of husband iterations.

research

Only 2 Brands Are Visible Across All AI Platforms. Is Yours One of Them?

We ran 480 queries across three AI platforms. Cross-model agreement on brand recommendations was only 10-45%. We identified 26 gender-locked brands, discovered that only LEGO and Disney achieve universal visibility, and found that AI recommends 41% fewer brands for wife queries than husband queries.

research

Cross-Model Response Stability Analysis: A Comparative Study of Brand Mention Consistency in Large Language Models

This study investigates response variability and brand mention consistency across three leading LLMs: Google Gemini 3 Flash, OpenAI GPT-5.2, and xAI Grok-4-1. Using 239 total samples across three prompt variations (husband, wife, 2025), we measured brand mention frequency, response consistency, and cross-model agreement.

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder & Lead Researcher

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

Usamos cookies

Usamos cookies essenciais para fazer nosso site funcionar. Com o seu consentimento, também podemos usar cookies analíticos para entender como você usa nossas ferramentas (como o Dice Roller) para que possamos melhorá-las. Saiba mais