Realizamos 1,279 consultas em três plataformas de IA e duas temporadas de presentes. O resultado: prova estatística definitiva de que a IA trata marcas de forma diferente conforme o gênero, e de que o viés muda de direção dependendo se você pergunta durante o Natal ou o Dia dos Namorados.
A descoberta que encerrou o debate
Há um ano, documentamos o viés de gênero nas recomendações de marcas feitas por IA. Primeiro, encontramos o fenômeno Kindle: 100% de visibilidade para consultas sobre esposas, 0% para consultas sobre maridos. Depois, ampliamos para presentes destinados a crianças e constatamos que o viés persistia: 28% menos marcas para filhas do que para filhos.
Alguns argumentaram que eram achados isolados. Peculiaridades das plataformas. Variação aleatória. Ruído estatístico.
Esta pesquisa encerra esse argumento.
1,279 consultas. Três estudos complementares. Dois contextos sazonais. Uma conclusão: o viés de gênero nas recomendações de IA é sistemático, comprovado estatisticamente e dependente do contexto.
O artigo, submetido à revista Human-Centric Intelligent Systems da Springer, fornece validação acadêmica formal do que observamos pela primeira vez em testes no mundo real. A evidência estatística já não é discutível.
O desenho dos três estudos: por que esta pesquisa é definitiva
A maioria das pesquisas sobre viés testa um único cenário e considera o trabalho concluído. Desenhamos três estudos interligados para eliminar toda explicação alternativa:
Estudo 1: Presentes de Natal para adultos (dezembro de 2025, n=299)
Prompts testados: marido/esposa/parceiro(a)/presente 2025 Principal achado: 41% menos marcas para consultas sobre esposas no Gemini Prova estatística: χ² = 137.32, p < 0.001
Estudo 2: Presentes de Natal para crianças (janeiro de 2026, n=480)
Prompts testados: filho/filha/criança/presente 2026 Principal achado: 28% menos marcas para consultas sobre filhas em todas as plataformas Prova estatística: χ² = 524.32, p < 0.001 (quase 4x mais forte que o Estudo 1)
Estudo 3: Presentes de Dia dos Namorados para parceiros (fevereiro de 2026, n=500)
Prompts testados: marido/esposa/namorado/namorada/parceiro(a) Principal achado: REVERSÃO sazonal; prompts com enquadramento feminino recebem 8.8% MAIS marcas no Gemini Prova estatística: χ² = 89.45, p < 0.001
Análise combinada: 1,279 observações independentes em 12 condições de prompt e 3 plataformas de IA.
Três estudos: tamanho da amostra e lacuna de gênero por estudo
A validação estatística é contundente. Valores de Cramér's V entre 0.23 e 0.38 indicam tamanhos de efeito médios a grandes. Intervalos de confiança por bootstrap confirmam que os efeitos são fortes. Isto é viés sistemático, não variação aleatória.
A reversão que mudou tudo
Eis o achado que transforma a forma como entendemos o viés da IA:
Enquadramento de Natal: a IA recomenda de 28% a 61% menos marcas para consultas voltadas ao público feminino Enquadramento de Dia dos Namorados: a IA recomenda 8.8% MAIS marcas para consultas voltadas ao público feminino no Gemini
A mesma IA. O mesmo universo de marcas. Estação diferente. Direção de viés oposta.
| Plataforma | Lacuna esposa (Natal) | Lacuna esposa (Dia dos Namorados) | Mudança sazonal |
|---|---|---|---|
| Gemini | -41% marcas | +8.8% marcas | 49.8% de reversão |
| GPT | -15% marcas | +12.1% marcas | 27.1% de reversão |
| Grok | -35% marcas | -2.3% marcas | 32.7% de reversão |
Reversão sazonal do viés: Natal vs Dia dos Namorados
Esta descoberta prova três pontos essenciais:
- O viés depende do contexto. A mesma estrutura de consulta produz resultados opostos em contextos sazonais diferentes.
- A IA aprendeu padrões culturais. O Dia dos Namorados é codificado como voltado ao feminino nos dados de treinamento, revertendo o viés masculino padrão.
- Medições em um único ponto não têm valor. Sua marca pode dominar um contexto sazonal enquanto fica invisível em outro.
O termo acadêmico para isso é "modulação de viés dependente do contexto". Em termos práticos: sua estratégia de visibilidade em IA precisa considerar a sazonalidade, caso contrário você está medindo metade do quadro.
69 marcas travadas por gênero: a lista completa
Ao longo dos três estudos, identificamos 69 marcas que aparecem exclusivamente em um enquadramento de gênero:
Marcas travadas no masculino (48 no total):
- Tecnologia/Gadgets: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
- Ferramentas: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
- Ar livre: Traeger, Weber, Osprey, North Face, Patagonia (parcial)
- Cuidados pessoais: Dollar Shave Club, Manscaped
- Relógios: Rolex, Omega, Seiko, Tissot
- Esportes: Titleist, Under Armour, Theragun (apenas no Natal)
Marcas travadas no feminino (17 no total):
- Casa: Stanley, KitchenAid, Vitamix, Breville, Our Place
- Beleza: Glossier, Kate Spade
- Bem-estar: Oura (apenas no Natal), Peloton (apenas no Natal)
- Leitura: Kindle (dominante no Natal, neutra no Dia dos Namorados)
- Joias: Tiffany (apenas no Dia dos Namorados)
Travas específicas de plataforma (4 marcas):
- Ray-Ban, LG, Google, Samsung aparecem apenas em consultas temporais/neutras
Nota do estudo: algumas marcas mudaram de categoria entre os estudos. A Theragun estava travada no masculino no Estudo 1, porém neutra no Estudo 3. O Kindle passou de 100% travado nas esposas para dependente da estação. A categorização de gênero feita pela IA não é estática.
Se sua marca está nesta lista, você fica invisível para metade do seu mercado potencial dependendo de como a pergunta é formulada. Nenhuma otimização de conteúdo resolverá isso: o viés existe no modelo de categorias da IA, não na sua mensagem.
O mecanismo: controle de acesso por categoria
Testamos duas hipóteses concorrentes sobre como a IA cria viés de gênero:
Hipótese 1: Concentração estereotipada A IA recomenda repetidamente as mesmas poucas marcas estereotipadas para consultas femininas (baixa diversidade).
Hipótese 2: Controle de acesso por categoria A IA exclui categorias inteiras de produtos das consultas femininas, mas distribui as recomendações de forma uniforme dentro das categorias permitidas (alta diversidade, porém um conjunto menor).
A análise de entropia de Shannon provou que a Hipótese 2 está correta.
Consultas voltadas ao feminino pontuam de 0.86 a 0.88 na entropia de Shannon (quase idêntico às consultas masculinas). Os coeficientes de Gini são, na verdade, MAIS BAIXOS para consultas femininas (0.30-0.48) do que para masculinas (0.41-0.57), o que indica uma distribuição mais uniforme entre as marcas recomendadas.
A IA está sendo excludente, não estereotipada.
O controle de acesso por categoria significa que a IA decide quais categorias de produto são "apropriadas" para cada gênero e, em seguida, exclui conjuntos inteiros de marcas da análise. Uma marca em uma categoria "codificada como masculina" nunca chega a entrar no conjunto de recomendações para consultas femininas.
Isso é pior do que o estereótipo. O estereótipo ao menos manteria sua marca visível (mesmo que posicionada de forma incorreta). O controle de acesso torna sua marca invisível para padrões inteiros de consulta.
Como o controle de acesso funciona na prática
Quando alguém pergunta "Qual é o melhor presente para minha esposa?", a IA não pesquisa todas as marcas para escolher as estereotipadas. Em vez disso:
- A IA identifica categorias de produto "apropriadas para o feminino": joias, artigos para casa, bem-estar, beleza, leitura
- A IA busca recomendações de marcas SOMENTE nessas categorias
- Marcas em categorias "codificadas como masculinas" (ferramentas, gadgets de tecnologia, equipamentos para ar livre, relógios) são excluídas da análise
- As recomendações são distribuídas de forma uniforme entre as categorias permitidas
O mesmo processo ocorre de forma inversa para consultas sobre maridos, só que com um conjunto maior de categorias permitidas (daí a contagem de marcas mais alta).
É por isso que o Kindle aparece para consultas sobre esposas e não sobre maridos. O e-reader da Amazon pertence ao agrupamento de categorias "leitura/casa", que a IA codificou como apropriado para o feminino. O produto é neutro em relação ao gênero. A atribuição de categoria não é.
Concordância entre modelos: ainda péssima
Apesar de analisarmos 1,279 consultas, as plataformas de IA ainda não conseguem concordar sobre quais marcas recomendar:
| Estudo | Sobreposição Gemini-GPT | Sobreposição Gemini-Grok | Sobreposição GPT-Grok |
|---|---|---|---|
| Estudo 1 (adultos no Natal) | 14% (Jaccard 0.08) | 45% (Jaccard 0.38) | 28% (Jaccard 0.17) |
| Estudo 2 (crianças no Natal) | 10% (Jaccard 0.10) | 42% (Jaccard 0.35) | 25% (Jaccard 0.20) |
| Estudo 3 (Dia dos Namorados) | 18% (Jaccard 0.12) | 51% (Jaccard 0.45) | 33% (Jaccard 0.25) |
Concordância entre modelos (Índice de Jaccard) nos estudos
Concordância média entre modelos: 20-35%.
Tradução: se você mede sua visibilidade em IA em apenas uma plataforma, está vendo de 20% a 35% da realidade. Os outros 65% a 80% das recomendações de marca são completamente diferentes nas plataformas concorrentes.
As personalidades das plataformas permanecem consistentes
As três plataformas mantêm "personalidades" distintas ao longo de todos os estudos:
GPT-5.2: o minimalista de marcas
- Média de 0.1 a 4.7 marcas por resposta (a mais baixa entre todos os estudos)
- Muitas vezes recomenda zero marcas específicas, preferindo categorias ("considere um smartwatch")
- A abstinência deliberada de marcas é uma escolha estratégica, não uma limitação de capacidade
Gemini: o maximalista de marcas
- Média de 3.7 a 11.9 marcas por resposta (a mais alta entre todos os estudos)
- Cita de forma consistente de 4 a 12 marcas específicas por resposta
- O mais suscetível aos efeitos de viés de gênero (as maiores lacunas entre consultas masculinas/femininas)
Grok: o meio-termo eficiente
- Média de 2.5 a 10.0 marcas por resposta
- A maior densidade de marcas por caractere (o mais focado em produtos)
- O mais estável entre os enquadramentos de gênero (as menores lacunas)
Se você está otimizando a visibilidade em IA sem testar as três plataformas, está otimizando para uma personalidade enquanto ignora as outras duas.
A métrica PASOR: medir o que realmente importa
Métricas tradicionais como "impressões" ou "rankings" não se aplicam às recomendações de IA. Ou você está incluído na resposta, ou você fica invisível. Não existe posição 1 contra posição 10.
Apresentamos a métrica Prompt-Adjusted Share of Recommendation (PASOR):
PASOR = (Your brand's appearance count / Total relevant queries) × 100
Exemplo: Kindle no Estudo 1 (adultos no Natal)
- Consultas sobre esposas: 100% de PASOR (39 aparições / 39 consultas sobre esposas)
- Consultas sobre parceiros(as): 100% de PASOR (30 aparições / 30 consultas sobre parceiros(as))
- Consultas sobre maridos: 0% de PASOR (0 aparições / 40 consultas sobre maridos)
- PASOR geral: 63.4% (69 aparições / 109 consultas no total)
Mas eis o problema: o PASOR geral mascara as lacunas de gênero. Se você mede apenas sua pontuação agregada, deixa de perceber que domina um grupo demográfico enquanto fica invisível para outro.
O PASOR segmentado por gênero revela a verdade:
- PASOR com enquadramento masculino: 0%
- PASOR com enquadramento feminino: 100%
- Lacuna: 100 pontos percentuais
Para marcas que buscam visibilidade equilibrada, a lacuna importa mais do que a média.
PASOR na prática: a reversão do Dia dos Namorados
PASOR do Estudo 3 para marcas selecionadas:
| Marca | PASOR marido | PASOR esposa | PASOR namorado | PASOR namorada | Lacuna |
|---|---|---|---|---|---|
| Tiffany | 0% | 73% | 0% | 80% | -73pp |
| Apple | 67% | 60% | 70% | 57% | +7pp (equilibrado) |
| LEGO | 33% | 20% | 37% | 23% | +13pp |
| Kindle | 27% | 40% | 23% | 43% | -13pp (neutro no Dia dos Namorados vs extremo no Natal) |
A Apple alcança um PASOR quase universal (57-70% em todos os enquadramentos). A Tiffany está completamente travada nos prompts femininos. A lacuna de gênero do Kindle diminuiu de 100 pontos percentuais no Estudo 1 para 13-17 pontos no Estudo 3, o que prova que as atribuições de categoria podem mudar conforme a estação.
A evidência estatística: além de qualquer dúvida
Para os leitores que questionam se esses efeitos são reais ou apenas ruído de medição, eis a validação estatística formal:
Testes qui-quadrado (independência categoria-gênero)
| Estudo | Valor de χ² | valor de p | Cramér's V | Tamanho de efeito | Interpretação |
|---|---|---|---|---|---|
| Estudo 1 | 137.32 | <0.001 | 0.23 | Médio | Rejeita a independência |
| Estudo 2 | 524.32 | <0.001 | 0.38 | Médio-Grande | Rejeita a independência |
| Estudo 3 | 89.45 | <0.001 | 0.26 | Médio | Rejeita a independência |
Tradução: há menos de 0.1% de chance de esses padrões serem aleatórios. As categorias de produto e o enquadramento de gênero estão sistematicamente ligados.
Tamanhos de efeito (lacunas na contagem de marcas)
| Comparação | Cohen's d | IC 95% | Tamanho de efeito | Significado prático |
|---|---|---|---|---|
| Estudo 1: marido vs esposa (Gemini) | 1.24 | [0.89, 1.59] | Grande | 41% menos marcas |
| Estudo 2: filho vs filha (todos os modelos) | 0.82 | [0.61, 1.03] | Grande | 28% menos marcas |
| Estudo 3: REVERSÃO da esposa no Dia dos Namorados | -0.31 | [-0.58, -0.04] | Pequeno | 8.8% MAIS marcas |
Os tamanhos de efeito são apresentados com intervalos de confiança por bootstrap (10,000 reamostragens). Todos os efeitos são robustos à variação de amostragem.
Validação cruzada
Validamos os achados usando oito testes estatísticos independentes:
- Testes qui-quadrado (associação categoria-gênero)
- Cohen's d (diferenças na contagem de marcas)
- Entropia de Shannon (diversidade dentro dos grupos de gênero)
- Coeficiente de Gini (concentração/desigualdade)
- Índice de Jaccard (sobreposição entre modelos)
- Cramér's V (tamanho de efeito para o qui-quadrado)
- Intervalos de confiança por bootstrap (verificação de robustez)
- Análise de migração de marcas (estabilidade temporal)
Todos os oito métodos convergem para a mesma conclusão: o viés de gênero é sistemático, dependente da plataforma e dependente do contexto.
O que mudou entre os estudos: padrões de migração de marcas
Algumas marcas mantiveram uma categorização de gênero consistente nos três estudos. Outras mudaram:
Travas de gênero estáveis:
- Travadas no masculino em todos os estudos: Garmin, DeWalt, Milwaukee, Rolex, Omega
- Travadas no feminino em todos os estudos: Stanley, KitchenAid, Glossier
Categorização alterada:
- Theragun: travada no masculino (Estudo 1) → neutra (Estudo 3)
- Peloton: travada no masculino (Estudo 1) → neutra (Estudo 3)
- Kindle: 100% travada no feminino (Estudo 1) → dependente da estação (Estudo 3, ainda com lacuna de 13-17pp)
- Oura: travada no feminino (Estudo 1) → neutra (Estudo 3)
Aparição apenas sazonal:
- Tiffany, Cartier: invisíveis nos estudos de Natal, travadas no feminino no estudo do Dia dos Namorados
- Ray-Ban, LG: apenas em consultas temporais, nunca com enquadramento de gênero
Conclusão principal: a categorização de gênero da IA evolui. Uma marca que estava travada por gênero no trimestre passado pode ter mudado. Testes regulares são a única forma de saber seu status atual.
Por que "parceiro(a)" e "criança" não são neutros em relação ao gênero
Testamos linguagem neutra em relação ao gênero nos três estudos. Os resultados provam que a neutralidade é uma ilusão.
Estudo 1: "parceiro(a)" = padrão de esposa
- Consultas sobre parceiros(as) compartilham 69.2% das marcas com consultas sobre esposas
- Consultas sobre parceiros(as) compartilham 37.5% das marcas com consultas sobre maridos
- "Parceiro(a)" não é neutro; por padrão, assume o enquadramento feminino.
Estudo 2: "criança" = padrão de filha
- Consultas sobre crianças compartilham 56.2% das marcas com consultas sobre filhas
- Consultas sobre crianças compartilham 42.6% das marcas com consultas sobre filhos
- "Criança" não é neutro; por padrão, assume o enquadramento feminino.
Estudo 3: "parceiro(a)" = padrão de esposa (novamente)
- Consultas sobre parceiros(as) compartilham 64.8% das marcas com consultas sobre esposas
- Consultas sobre parceiros(as) compartilham 41.3% das marcas com consultas sobre maridos
- O padrão persiste entre os contextos sazonais.
Se a estratégia da sua marca se apoia em um posicionamento "inclusivo" ou "neutro em relação ao gênero", você pode estar otimizando para a visibilidade de enquadramento feminino e deixando de fora, por completo, as recomendações de enquadramento masculino. A IA interpreta a neutralidade como feminina por padrão.
A dependência do contexto sazonal: Natal vs Dia dos Namorados
Este é o achado que muda de forma fundamental como entendemos o viés da IA.
Hipótese testada: o mesmo enquadramento de gênero produz um viés consistente em diferentes contextos sazonais?
Resposta: não. A direção do viés se inverte.
| Métrica | Natal (Estudos 1 e 2) | Dia dos Namorados (Estudo 3) | Mudança |
|---|---|---|---|
| Lacuna esposa vs marido no Gemini | -41% marcas | +8.8% marcas | 49.8pp de reversão |
| Marcas travadas no feminino | 17 marcas | 12 marcas (mas um conjunto diferente) | -29% |
| Marcas travadas no masculino | 48 marcas | 22 marcas (mas um conjunto diferente) | -54% |
| Equilíbrio de PASOR neutro em gênero | Enviesado para o feminino | Mais equilibrado | Melhorou |
Por que isso acontece: os dados de treinamento da IA codificam padrões culturais. A troca de presentes de Natal tem, tradicionalmente, um enquadramento masculino na cultura ocidental (maridos compram presentes para as esposas, pais compram para os filhos). O Dia dos Namorados tem enquadramento feminino (namorados compram para as namoradas, maridos para as esposas).
A IA aplica padrões aprendidos, específicos de cada contexto, a partir dos dados de treinamento, não um viés de gênero universal.
Isso explica por que as medições em um único ponto induzem ao erro. Uma marca que domina as recomendações de Natal pode ficar invisível durante o Dia dos Namorados, ou vice-versa. Testar por estação é obrigatório para uma avaliação completa de visibilidade.
O que isso significa para a sua marca
Se você está em uma categoria "codificada como masculina"
Exemplos: ferramentas, gadgets de tecnologia, equipamentos para ar livre, equipamentos esportivos, relógios de luxo
Sua realidade:
- Forte visibilidade em consultas sobre marido/filho/namorado
- Visibilidade fraca ou nula em consultas sobre esposa/filha/namorada durante o Natal
- Pode melhorar a visibilidade em consultas de enquadramento feminino durante o Dia dos Namorados (depende da plataforma)
Seu risco:
- Perder de 40% a 50% do mercado potencial durante as temporadas de presentes de alto volume
- A otimização de conteúdo não resolverá isso: o viés está no modelo de categorias da IA
Sua estratégia:
- Teste o PASOR em todos os enquadramentos de gênero para cada contexto sazonal
- Identifique quais contextos sazonais favorecem sua categoria
- Programe as grandes campanhas em torno das janelas sazonais favoráveis
- Avalie se a atribuição da sua categoria está correta (recorra às equipes de IA se não estiver)
Se você está em uma categoria "codificada como feminina"
Exemplos: joias, artigos para casa, beleza, bem-estar, eletrodomésticos de cozinha
Sua realidade:
- Forte visibilidade em consultas sobre esposa/filha/namorada durante o Natal
- Pode ter uma vantagem reduzida durante o Dia dos Namorados (reversão sazonal)
- Visibilidade fraca ou nula em consultas sobre marido/filho/namorado
Seu risco:
- Deixar de 40% a 50% do mercado para concorrentes que resolveram o problema de categoria
- Ficar invisível para homens que dão presentes e querem comprar seu produto para si mesmos
Sua estratégia:
- Teste se seu produto é realmente específico de gênero ou apenas categorizado por gênero
- Se o produto é neutro, mas está travado por categoria, crie conteúdo que conecte categorias
- Acompanhe as mudanças sazonais: sua vantagem no Dia dos Namorados pode não persistir o ano todo
Se você é específico de plataforma
Exemplos: Ray-Ban, Samsung, Google (aparição apenas temporal), Tiffany (apenas no Dia dos Namorados)
Sua realidade:
- Invisível em consultas padrão com enquadramento de gênero
- Aparece apenas em contextos temporais ou específicos de uma estação
- Pode estar excluído dos dados de treinamento do LLM ou ficar abaixo dos limiares de recomendação
Sua estratégia:
- Investigue por que você está ausente das recomendações padrão
- Aumente as menções à marca nos contextos que a IA usa para treinamento
- Teste se estruturas de consulta diferentes liberam visibilidade
Se você alcança um PASOR equilibrado (como a Apple)
Marcas equilibradas: Apple, Sony, Bose, LEGO, Patagonia, Nintendo
Sua realidade:
- Aparece de forma consistente entre os enquadramentos de gênero (variação de ±10-15%)
- Mantém visibilidade entre os contextos sazonais
- Não está travado em nenhuma categoria demográfica específica
Sua vantagem:
- Alcance máximo de recomendação em todos os tipos de consulta
- Menor risco de volatilidade sazonal
- Mais protegido do controle de acesso por categoria
Sua estratégia:
- Mantenha um posicionamento equilibrado em todo o conteúdo
- Monitore o desvio de categoria que poderia travar você em um único grupo demográfico
- Use seu status equilibrado como vantagem competitiva
A validação acadêmica: a revisão por pares importa
Esta pesquisa foi submetida à revista Human-Centric Intelligent Systems da Springer, uma publicação acadêmica com revisão por pares na área de IA e interação humano-computador.
Por que isso importa:
-
Revisão independente: três especialistas anônimos em pesquisa de viés de IA vão validar a metodologia, o rigor estatístico e as conclusões antes da publicação.
-
Reprodutibilidade: a metodologia completa, os testes estatísticos e os tamanhos de efeito estão documentados. Outros pesquisadores podem replicar os achados.
-
Permanência da citação: uma vez publicada, esta pesquisa passa a fazer parte do registro acadêmico permanente sobre viés de IA, citada por estudos futuros.
-
Credibilidade no setor: a validação acadêmica tem peso junto a compradores corporativos, reguladores e imprensa.
O pacote de submissão inclui:
- Artigo completo (30 páginas, 1,279 observações analisadas)
- Apêndice estatístico com todos os oito testes de validação
- Declaração de disponibilidade dos dados brutos
- Declaração de conflito de interesses (pesquisa financiada pela Rankfor.AI, autor é o fundador)
Status atual: em revisão (submetido em fevereiro de 2026). Decisão prevista: abril-maio de 2026.
Se você está apresentando esta pesquisa a executivos, reguladores ou jornalistas, pode citá-la como "em revisão por pares na Springer Human-Centric Intelligent Systems". Uma vez aceita, torna-se literatura acadêmica passível de citação.
As implicações para a pesquisa de justiça em IA
Esta pesquisa contribui para a literatura mais ampla de justiça em IA de três formas:
1. Modulação de viés dependente do contexto
Os trabalhos anteriores sobre viés de IA pressupõem que o viés é estático: se um modelo é enviesado, aplica esse viés de forma consistente. Nossos achados provam que isso está errado para as recomendações de LLM.
Contribuição principal: o viés de gênero na IA comercial é um parâmetro variável, modulado pelo contexto sazonal, pelo tipo de destinatário e pelo enquadramento da relação. Auditorias de justiça que testam apenas um contexto vão deixar passar reversões em outros contextos.
2. Desafios do aprendizado em mundo aberto
Os LLMs operam em ambientes de mundo aberto, nos quais as consultas dos usuários percorrem contextos demográficos e sazonais ilimitados. A detecção tradicional de viés em mundo fechado (testes em conjuntos de dados fixos) não consegue capturar essa complexidade.
Contribuição principal: demonstramos que o viés dos LLMs se manifesta de forma diferente entre contextos sazonais que provavelmente estavam sub-representados nos dados de treinamento. Isso está em sintonia com a pesquisa de aprendizado em mundo aberto sobre como os modelos generalizam para além das distribuições de treinamento.
3. Controle de acesso por categoria como mecanismo de viés
A maioria das pesquisas sobre viés foca na concentração estereotipada (recomendar repetidamente as mesmas poucas opções). Identificamos um mecanismo diferente.
Contribuição principal: a IA exclui categorias inteiras de produtos da análise e distribui as recomendações de forma uniforme dentro das categorias permitidas; ela não recorre a estereótipos com conjuntos restritos de marcas nas consultas femininas. Esse "controle de acesso por categoria" é mais difícil de detectar porque as métricas de diversidade (entropia de Shannon, coeficiente de Gini) parecem normais.
O que você deve fazer agora
1. Faça uma auditoria de PASOR multi-sazonal
Teste sua marca em:
- Todos os enquadramentos de gênero (marido/esposa/namorado/namorada/parceiro(a))
- Todos os contextos sazonais (Natal, Dia dos Namorados, Dia das Mães/Dia dos Pais, aniversários)
- As três principais plataformas (Gemini, GPT, Grok)
Meça o PASOR para cada combinação. Identifique onde você está visível, onde está bloqueado e se você enfrenta reversões sazonais.
2. Verifique a atribuição da sua categoria
Se você está travado por gênero, mas seu produto é realmente neutro em relação ao gênero, investigue:
- A quais categorias de produto a IA associa sua marca?
- Essas categorias são codificadas como masculinas ou femininas nas respostas da IA?
- Você consegue conectar categorias por meio de conteúdo que atravessa fronteiras demográficas?
3. Monitore a migração de marcas
Nossa pesquisa prova que a categorização de gênero é dinâmica. As marcas mudam de categoria entre os estudos. Configure testes trimestrais para detectar quando seu status muda.
4. Segmente suas métricas de visibilidade
O PASOR geral esconde lacunas de gênero. Sempre reporte:
- PASOR de enquadramento masculino (marido/filho/namorado)
- PASOR de enquadramento feminino (esposa/filha/namorada)
- PASOR de enquadramento neutro (parceiro(a)/criança)
- Lacuna entre masculino e feminino (isso importa mais do que a média)
5. Ajuste a estratégia por estação
Se você descobrir reversões sazonais (como a mudança do Natal para o Dia dos Namorados), programe suas campanhas de acordo:
- Reforce mensagens voltadas ao feminino nas estações em que as consultas de enquadramento feminino recebem mais marcas
- Reforce mensagens voltadas ao masculino nas estações em que as consultas de enquadramento masculino predominam
- Teste contextos sazonais emergentes (Prime Day, Black Friday, volta às aulas)
Verifique se sua marca está travada por gênero
Criamos uma ferramenta gratuita que submete sua marca à mesma análise que usamos nesta pesquisa.
O que você vai ver:
- Pontuações de PASOR em todos os enquadramentos de gênero
- Quais contextos sazonais favorecem sua marca
- Como sua visibilidade se compara entre Gemini, GPT e Grok
- Se você está travado por categoria como o Kindle ou equilibrado como a Apple
Três prompts. Três plataformas. Três contextos sazonais. Análise instantânea de PASOR.
Sem necessidade de e-mail. Leva 90 segundos.
Verifique o status de trava de gênero da sua marca
Resumo da metodologia
- Total de consultas: 1,279 (299 + 480 + 500 nos três estudos)
- Plataformas testadas: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
- Prompts por estudo:
- Estudo 1: 4 condições (marido/esposa/parceiro(a)/2025)
- Estudo 2: 4 condições (filho/filha/criança/2026)
- Estudo 3: 5 condições (marido/esposa/namorado/namorada/parceiro(a))
- Temperatura: 0.7 (Estudos 2-3), padrão (Estudo 1)
- Coleta de dados: dezembro de 2025 a fevereiro de 2026
- Validação estatística: testes qui-quadrado, Cohen's d, Cramér's V, entropia de Shannon, coeficiente de Gini, índice de Jaccard, intervalos de confiança por bootstrap
- Tamanhos de efeito: médios a grandes (Cramér's V = 0.23-0.38, Cohen's d = 0.82-1.24)
- Revisão por pares: submetido à Springer Human-Centric Intelligent Systems, fevereiro de 2026
Apêndice estatístico completo e dados brutos disponíveis mediante solicitação. Entre em contato pelo research@rankfor.ai para propostas de colaboração acadêmica.
Pesquisas relacionadas
Kindle: 100% das consultas sobre esposas. 0% das consultas sobre maridos. A mesma IA.
Nossa descoberta original (dezembro de 2025, n=299) que identificou pela primeira vez o fenômeno Kindle e estabeleceu a base estatística para o viés de gênero nas recomendações de LLM. Esta pesquisa se tornou o Estudo 1 na análise dos três estudos.
Principal achado: 41% menos marcas para consultas sobre esposas. Qui-quadrado 137.32, p<0.001.
Apenas 2 marcas são visíveis em todas as plataformas de IA. A sua é uma delas?
O estudo sobre presentes para crianças (janeiro de 2026, n=480) que provou que o viés de gênero se estende para além dos contextos adultos e mostrou que a visibilidade universal é quase impossível de alcançar. Esta pesquisa se tornou o Estudo 2 na análise dos três estudos.
Principal achado: apenas LEGO e Disney alcançam visibilidade universal entre plataformas. 28% menos marcas para consultas sobre filhas.
Pesquisa conduzida por Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Submetida à Springer Human-Centric Intelligent Systems, fevereiro de 2026. Artigo completo, apêndice estatístico e dados brutos disponíveis mediante solicitação.
Termos-chave
PASOR (Prompt-Adjusted Share of Recommendation): o percentual de consultas relevantes em que sua marca aparece nas respostas da IA. Diferentemente dos rankings tradicionais, o PASOR mede inclusão versus exclusão, não posição.
Controle de acesso por categoria: quando a IA exclui categorias inteiras de produtos das consultas específicas de gênero, sem se limitar a estereotipar dentro de um conjunto permitido. Identificado como o principal mecanismo de viés por meio da análise de entropia de Shannon.
Marca travada por gênero: uma marca que aparece exclusivamente em um enquadramento de gênero (por exemplo, apenas em consultas sobre maridos) e nunca em outros. Nossa pesquisa identificou 69 marcas desse tipo nos três estudos.
Reversão sazonal de viés: quando a direção do viés de gênero muda conforme o contexto sazonal. O Natal reduz as recomendações de enquadramento feminino em 28-61%, enquanto o Dia dos Namorados as aumenta em 8.8% (Gemini).
Concordância entre modelos (índice de Jaccard): o percentual de marcas recomendadas por múltiplas plataformas de IA para a mesma consulta. Uma concordância baixa (10-45% em nossos estudos) indica visibilidade dependente da plataforma.
Cramér's V: uma medida da força de associação para testes qui-quadrado, que varia de 0 (nenhuma associação) a 1 (associação perfeita). Valores de 0.23-0.38 indicam associações médias a grandes entre gênero e categoria em nossos estudos.
Cohen's d: uma medida padronizada da diferença entre dois grupos. Valores de 0.82-1.24 indicam grandes diferenças práticas na contagem de marcas entre os enquadramentos de gênero.
Migração de marcas: quando a categorização de gênero de uma marca muda entre os períodos de medição. Theragun, Peloton e Oura passaram de travadas por gênero para neutras entre os estudos.
