research

Cuando la IA cambia de opinión sobre el género: tres estudios prueban que el sesgo es real, sistemático y estacional

February 15, 2026
20 min read
n=929
Dmitrij Żatuchin
Gender BiasAI ResearchLLM RecommendationsSeasonal BiasCategory GatekeepingPASORGeminiGPT

Ejecutamos 1.279 consultas en tres plataformas de IA y dos temporadas de regalos. El resultado: prueba estadística definitiva de que la IA trata a las marcas de forma distinta según el género, y de que el sesgo cambia de dirección según preguntes en Navidad o en San Valentín.


El descubrimiento que puso fin al debate

Durante un año hemos estado documentando el sesgo de género en las recomendaciones de marca de la IA. Primero encontramos el fenómeno Kindle: 100% de visibilidad para consultas sobre la esposa, 0% para consultas sobre el marido. Después lo ampliamos a los destinatarios infantiles y comprobamos que el sesgo persistía: 28% menos marcas para las hijas que para los hijos.

Algunos sostenían que se trataba de hallazgos aislados. Rarezas de plataforma. Variación aleatoria. Ruido estadístico.

Esta investigación pone fin a ese argumento.

1.279 consultas. Tres estudios complementarios. Dos contextos estacionales. Una conclusión: el sesgo de género en las recomendaciones de IA es sistemático, está probado estadísticamente y depende del contexto.

El artículo, presentado a la revista Human-Centric Intelligent Systems de Springer, ofrece la validación académica formal de lo que observamos por primera vez en pruebas del mundo real. La evidencia estadística ya no es discutible.


El diseño de tres estudios: por qué esta investigación es definitiva

La mayoría de las investigaciones sobre sesgo prueban un escenario y dan el tema por cerrado. Nosotros diseñamos tres estudios entrelazados para eliminar cualquier explicación alternativa:

Estudio 1: regalos de Navidad para adultos (diciembre de 2025, n=299)

Prompts probados: regalo para marido/esposa/pareja/2025 Hallazgo clave: 41% menos marcas para consultas sobre la esposa en Gemini Prueba estadística: χ² = 137,32, p < 0,001

Estudio 2: regalos de Navidad para niños (enero de 2026, n=480)

Prompts probados: regalo para hijo/hija/niño/2026 Hallazgo clave: 28% menos marcas para consultas sobre la hija en todas las plataformas Prueba estadística: χ² = 524,32, p < 0,001 (casi 4 veces más fuerte que el Estudio 1)

Estudio 3: regalos de San Valentín para parejas (febrero de 2026, n=500)

Prompts probados: marido/esposa/novio/novia/pareja Hallazgo clave: INVERSIÓN estacional; los prompts con enfoque femenino reciben un 8,8% MÁS de marcas en Gemini Prueba estadística: χ² = 89,45, p < 0,001

Análisis combinado: 1.279 observaciones independientes en 12 condiciones de prompt y 3 plataformas de IA.

Could not load chart data

La validación estadística es abrumadora. Los valores de la V de Cramér de 0,23-0,38 indican tamaños de efecto de medianos a grandes. Los intervalos de confianza por bootstrap confirman que los efectos son fuertes. Esto no es variación aleatoria. Esto es sesgo sistemático.


La inversión que lo cambió todo

Este es el hallazgo que transforma nuestra forma de entender el sesgo de la IA:

Enfoque navideño: la IA recomienda entre un 28% y un 61% menos de marcas para consultas dirigidas a mujeres Enfoque de San Valentín: la IA recomienda un 8,8% MÁS de marcas para consultas dirigidas a mujeres en Gemini

La misma IA. El mismo universo de marcas. Una temporada distinta. Dirección de sesgo opuesta.

PlataformaBrecha de la esposa en NavidadBrecha de la esposa en San ValentínCambio estacional
Gemini-41% marcas+8,8% marcas49,8% inversión
GPT-15% marcas+12,1% marcas27,1% inversión
Grok-35% marcas-2,3% marcas32,7% inversión
Could not load chart data

Este descubrimiento prueba tres puntos fundamentales:

  1. El sesgo depende del contexto. La misma estructura de consulta produce resultados opuestos en distintos contextos estacionales.
  2. La IA ha aprendido patrones culturales. San Valentín está codificado como orientado a lo femenino en los datos de entrenamiento, lo que invierte el sesgo masculino por defecto.
  3. Las mediciones de un solo punto no significan nada. Tu marca podría dominar un contexto estacional y ser invisible en otro.

El término académico para esto es "modulación del sesgo dependiente del contexto". El término práctico es: tu estrategia de visibilidad en IA debe tener en cuenta la estacionalidad, o estarás midiendo la mitad de la imagen.


69 marcas bloqueadas por género: la lista completa

En los tres estudios identificamos 69 marcas que aparecen exclusivamente bajo un enfoque de género:

Marcas bloqueadas como masculinas (48 en total):

  • Tecnología/Gadgets: Garmin, GoPro, Oculus, Philips Norelco, Manscaped
  • Herramientas: DeWalt, Milwaukee, Leatherman, Craftsman, Benchmade
  • Aire libre: Traeger, Weber, Osprey, North Face, Patagonia (parcial)
  • Cuidado personal: Dollar Shave Club, Manscaped
  • Relojes: Rolex, Omega, Seiko, Tissot
  • Deportes: Titleist, Under Armour, Theragun (solo en Navidad)

Marcas bloqueadas como femeninas (17 en total):

  • Hogar: Stanley, KitchenAid, Vitamix, Breville, Our Place
  • Belleza: Glossier, Kate Spade
  • Bienestar: Oura (solo en Navidad), Peloton (solo en Navidad)
  • Lectura: Kindle (dominante en Navidad, neutral en San Valentín)
  • Joyería: Tiffany (solo en San Valentín)

Bloqueos específicos de plataforma (4 marcas):

  • Ray-Ban, LG, Google y Samsung aparecen solo en consultas temporales/neutras

Nota del estudio: algunas marcas cambiaron entre estudios. Theragun estaba bloqueada como masculina en el Estudio 1 pero era neutral en el Estudio 3. Kindle pasó de estar 100% bloqueada como femenina a depender de la temporada. La categorización de género de la IA no es estática.

Si tu marca está en esta lista, eres invisible para la mitad de tu mercado potencial según cómo se formule la pregunta. Ninguna optimización de contenido lo va a arreglar; el sesgo está en el modelo de categorías de la IA, no en tu mensaje.


El mecanismo: control de acceso por categoría

Probamos dos hipótesis en competencia sobre cómo la IA genera el sesgo de género:

Hipótesis 1: concentración estereotípica La IA recomienda repetidamente las mismas pocas marcas estereotípicas para las consultas femeninas (baja diversidad).

Hipótesis 2: control de acceso por categoría La IA excluye categorías de producto enteras de las consultas femeninas, pero distribuye las recomendaciones de forma uniforme dentro de las categorías permitidas (alta diversidad, pero un conjunto más pequeño).

El análisis de entropía de Shannon probó que la Hipótesis 2 es correcta.

Las consultas dirigidas a mujeres puntúan 0,86-0,88 en entropía de Shannon (casi idéntico a las consultas masculinas). Los coeficientes de Gini son incluso MÁS BAJOS para las consultas femeninas (0,30-0,48) que para las masculinas (0,41-0,57), lo que significa una distribución más uniforme entre las marcas recomendadas.

La IA no está siendo estereotípica. La IA está siendo excluyente.

El control de acceso por categoría significa que la IA decide qué categorías de producto son "apropiadas" para cada género y luego excluye conjuntos de marcas enteros de la consideración. Una marca de una categoría "codificada como masculina" nunca entra siquiera en el conjunto de recomendaciones para las consultas femeninas.

Esto es peor que el estereotipo. El estereotipo al menos mantendría tu marca visible (aunque estuviera posicionada de forma incorrecta). El control de acceso hace que tu marca sea invisible para patrones de consulta enteros.

Cómo funciona el control de acceso en la práctica

Cuando alguien pregunta "¿Cuál es el mejor regalo para mi esposa?", la IA no busca en todas las marcas y elige las estereotípicas. En vez de eso:

  1. La IA identifica las categorías de producto "apropiadas para mujeres": joyería, artículos para el hogar, bienestar, belleza, lectura
  2. La IA busca recomendaciones de marca SOLO en esas categorías
  3. Las marcas de categorías "codificadas como masculinas" (herramientas, gadgets tecnológicos, equipamiento de aire libre, relojes) quedan excluidas de la consideración
  4. Las recomendaciones se distribuyen de forma uniforme entre las categorías permitidas

El mismo proceso ocurre a la inversa para las consultas sobre el marido, solo que con un conjunto de categorías permitidas más amplio (de ahí los recuentos de marcas más altos).

Por eso Kindle aparece en las consultas sobre la esposa y no en las del marido. El lector electrónico de Amazon pertenece al grupo de categorías "lectura/hogar", que la IA ha codificado como apropiado para mujeres. El producto es neutral en cuanto al género. La asignación de categoría no lo es.


Coincidencia entre modelos: sigue siendo pésima

A pesar de analizar 1.279 consultas, las plataformas de IA siguen sin ponerse de acuerdo sobre qué marcas recomendar:

EstudioCoincidencia Gemini-GPTCoincidencia Gemini-GrokCoincidencia GPT-Grok
Estudio 1 (adultos en Navidad)14% (Jaccard 0,08)45% (Jaccard 0,38)28% (Jaccard 0,17)
Estudio 2 (niños en Navidad)10% (Jaccard 0,10)42% (Jaccard 0,35)25% (Jaccard 0,20)
Estudio 3 (San Valentín)18% (Jaccard 0,12)51% (Jaccard 0,45)33% (Jaccard 0,25)

Coincidencia entre modelos (índice de Jaccard) en los estudios

0.080.10.120.380.350.450.170.20.25Study 1Study 2Study 300.10.20.30.4
Gemini-GPTGemini-GrokGPT-Grok

Coincidencia media entre modelos: 20-35%.

Traducción: si mides tu visibilidad en IA en una sola plataforma, estás viendo entre el 20% y el 35% de la realidad. El otro 65-80% de las recomendaciones de marca es completamente distinto en las plataformas competidoras.

Las personalidades de las plataformas se mantienen consistentes

Las tres plataformas conservan "personalidades" distintas a lo largo de todos los estudios:

GPT-5.2: el minimalista de marcas

  • Promedia 0,1-4,7 marcas por respuesta (el más bajo de todos los estudios)
  • A menudo no recomienda ninguna marca concreta y prefiere las categorías ("considera un smartwatch")
  • La abstinencia deliberada de marcas es una decisión estratégica, no una limitación de capacidad

Gemini: el maximalista de marcas

  • Promedia 3,7-11,9 marcas por respuesta (el más alto de todos los estudios)
  • Nombra de forma consistente entre 4 y 12 marcas concretas por respuesta
  • El más susceptible a los efectos del sesgo de género (las mayores brechas entre consultas masculinas y femeninas)

Grok: el término medio eficiente

  • Promedia 2,5-10,0 marcas por respuesta
  • La mayor densidad de marcas por carácter (el más centrado en el producto)
  • El más estable entre enfoques de género (las brechas más pequeñas)

Si optimizas tu visibilidad en IA sin probar las tres plataformas, estás optimizando para una personalidad e ignorando las otras dos.


La métrica PASOR: medir lo que de verdad importa

Las métricas tradicionales como "impresiones" o "posiciones" no se aplican a las recomendaciones de IA. O estás incluido en la respuesta o eres invisible. No existe la posición 1 frente a la posición 10.

Presentamos la métrica Prompt-Adjusted Share of Recommendation (PASOR):

PASOR = (Número de apariciones de tu marca / Total de consultas relevantes) × 100

Ejemplo: Kindle en el Estudio 1 (adultos en Navidad)

  • Consultas sobre la esposa: 100% PASOR (39 apariciones / 39 consultas sobre la esposa)
  • Consultas sobre la pareja: 100% PASOR (30 apariciones / 30 consultas sobre la pareja)
  • Consultas sobre el marido: 0% PASOR (0 apariciones / 40 consultas sobre el marido)
  • PASOR general: 63,4% (69 apariciones / 109 consultas totales)

Pero aquí está el problema: el PASOR general enmascara las brechas de género. Si mides solo tu puntuación agregada, se te escapará que dominas un grupo demográfico mientras eres invisible para otro.

El PASOR segmentado por género revela la verdad:

  • PASOR con enfoque masculino: 0%
  • PASOR con enfoque femenino: 100%
  • Brecha: 100 puntos porcentuales

Para las marcas que buscan una visibilidad equilibrada, la brecha importa más que la media.

PASOR en acción: la inversión de San Valentín

PASOR del Estudio 3 para marcas seleccionadas:

MarcaPASOR maridoPASOR esposaPASOR novioPASOR noviaBrecha
Tiffany0%73%0%80%-73pp
Apple67%60%70%57%+7pp (equilibrado)
LEGO33%20%37%23%+13pp
Kindle27%40%23%43%-13pp (neutral en San Valentín vs extremo en Navidad)

Apple alcanza un PASOR casi universal (57-70% en todos los enfoques). Tiffany está totalmente bloqueada como femenina en los prompts. La brecha de género de Kindle se estrechó de 100 puntos porcentuales en el Estudio 1 a 13-17 puntos en el Estudio 3, lo que demuestra que las asignaciones de categoría pueden cambiar según la temporada.


La evidencia estadística: fuera de toda duda

Para quienes se pregunten si estos efectos son reales o solo ruido de medición, aquí está la validación estadística formal:

Pruebas de chi cuadrado (independencia categoría-género)

EstudioValor χ²valor pV de CramérTamaño del efectoInterpretación
Estudio 1137,32<0,0010,23MedianoRechazar independencia
Estudio 2524,32<0,0010,38Mediano-grandeRechazar independencia
Estudio 389,45<0,0010,26MedianoRechazar independencia

Traducción: hay menos de un 0,1% de probabilidad de que estos patrones sean aleatorios. Las categorías de producto y el enfoque de género están vinculados de forma sistemática.

Tamaños de efecto (brechas en el recuento de marcas)

Comparaciónd de CohenIC 95%Tamaño del efectoSignificado práctico
Estudio 1: marido vs esposa (Gemini)1,24[0,89, 1,59]Grande41% menos marcas
Estudio 2: hijo vs hija (todos los modelos)0,82[0,61, 1,03]Grande28% menos marcas
Estudio 3: INVERSIÓN esposa en San Valentín-0,31[-0,58, -0,04]Pequeño8,8% MÁS marcas

Los tamaños de efecto se informan con intervalos de confianza por bootstrap (10.000 remuestreos). Todos los efectos son fuertes frente a la variación de muestreo.

Validación cruzada

Validamos los hallazgos usando ocho pruebas estadísticas independientes:

  1. Pruebas de chi cuadrado (asociación categoría-género)
  2. d de Cohen (diferencias en el recuento de marcas)
  3. Entropía de Shannon (diversidad dentro de los grupos de género)
  4. Coeficiente de Gini (concentración/desigualdad)
  5. Índice de Jaccard (coincidencia entre modelos)
  6. V de Cramér (tamaño del efecto para chi cuadrado)
  7. Intervalos de confianza por bootstrap (comprobación de robustez)
  8. Análisis de migración de marcas (estabilidad temporal)

Los ocho métodos convergen en la misma conclusión: el sesgo de género es sistemático, depende de la plataforma y depende del contexto.

Could not load chart data

Qué cambió entre estudios: patrones de migración de marcas

Algunas marcas mantuvieron una categorización de género consistente en los tres estudios. Otras cambiaron:

Bloqueos de género estables:

  • Bloqueadas como masculinas en todos los estudios: Garmin, DeWalt, Milwaukee, Rolex, Omega
  • Bloqueadas como femeninas en todos los estudios: Stanley, KitchenAid, Glossier

Categorización cambiada:

  • Theragun: bloqueada como masculina (Estudio 1) → neutral (Estudio 3)
  • Peloton: bloqueada como masculina (Estudio 1) → neutral (Estudio 3)
  • Kindle: 100% bloqueada como femenina (Estudio 1) → dependiente de la temporada (Estudio 3, aún con una brecha de 13-17pp)
  • Oura: bloqueada como femenina (Estudio 1) → neutral (Estudio 3)

Aparición solo estacional:

  • Tiffany, Cartier: invisibles en los estudios navideños, bloqueadas como femeninas en el estudio de San Valentín
  • Ray-Ban, LG: solo en consultas temporales, nunca con enfoque de género

Idea clave: la categorización de género de la IA evoluciona. Una marca que estaba bloqueada por género el trimestre pasado podría haber cambiado. Las pruebas periódicas son la única forma de conocer tu estado actual.


Por qué "pareja" e "hijo/a" no son neutros en cuanto al género

Probamos lenguaje neutro en cuanto al género en los tres estudios. Los resultados prueban que la neutralidad es una ilusión.

Estudio 1: "pareja" = patrón de esposa

  • Las consultas sobre la pareja comparten el 69,2% de las marcas con las consultas sobre la esposa
  • Las consultas sobre la pareja comparten el 37,5% de las marcas con las consultas sobre el marido
  • "Pareja" no es neutral. Por defecto adopta el enfoque femenino.

Estudio 2: "hijo/a" = patrón de hija

  • Las consultas sobre el hijo/a comparten el 56,2% de las marcas con las consultas sobre la hija
  • Las consultas sobre el hijo/a comparten el 42,6% de las marcas con las consultas sobre el hijo
  • "Hijo/a" no es neutral. Por defecto adopta el enfoque femenino.

Estudio 3: "pareja" = patrón de esposa (otra vez)

  • Las consultas sobre la pareja comparten el 64,8% de las marcas con las consultas sobre la esposa
  • Las consultas sobre la pareja comparten el 41,3% de las marcas con las consultas sobre el marido
  • El patrón persiste en los distintos contextos estacionales.

Si tu estrategia de marca se apoya en un posicionamiento "inclusivo" o "neutral en cuanto al género", puede que estés optimizando para la visibilidad con enfoque femenino y perdiendo por completo las recomendaciones con enfoque masculino. La IA interpreta la neutralidad como femenina por defecto.


La dependencia del contexto estacional: Navidad frente a San Valentín

Este es el hallazgo que cambia de raíz nuestra forma de entender el sesgo de la IA.

Hipótesis probada: ¿el mismo enfoque de género produce un sesgo consistente en distintos contextos estacionales?

Respuesta: no. La dirección del sesgo se invierte.

MétricaNavidad (Estudios 1 y 2)San Valentín (Estudio 3)Cambio
Brecha Gemini esposa vs marido-41% marcas+8,8% marcas49,8pp inversión
Marcas bloqueadas como femeninas17 marcas12 marcas (pero conjunto distinto)-29%
Marcas bloqueadas como masculinas48 marcas22 marcas (pero conjunto distinto)-54%
Equilibrio de PASOR neutralSesgado a lo femeninoMás equilibradoMejorado

Por qué ocurre esto: los datos de entrenamiento de la IA codifican patrones culturales. Los regalos de Navidad tienen tradicionalmente un enfoque masculino en la cultura occidental (los maridos compran regalos para las esposas, los padres compran para los hijos). San Valentín tiene un enfoque femenino (los novios compran para las novias, los maridos para las esposas).

La IA no aplica un sesgo de género universal. Aplica patrones aprendidos específicos del contexto a partir de los datos de entrenamiento.

Esto explica por qué las mediciones de un solo punto son engañosas. Una marca que domina las recomendaciones navideñas podría ser invisible en San Valentín, o al revés. Las pruebas estacionales son obligatorias para una evaluación completa de la visibilidad.


Qué significa esto para tu marca

Si estás en una categoría "codificada como masculina"

Ejemplos: herramientas, gadgets tecnológicos, equipamiento de aire libre, material deportivo, relojes de lujo

Tu realidad:

  • Fuerte visibilidad en consultas sobre marido/hijo/novio
  • Visibilidad débil o nula en consultas sobre esposa/hija/novia durante la Navidad
  • Puede mejorar la visibilidad en consultas con enfoque femenino durante San Valentín (según la plataforma)

Tu riesgo:

  • Perder entre el 40% y el 50% del mercado potencial durante las temporadas de regalos de gran volumen
  • La optimización de contenido no lo va a arreglar; el sesgo está en el modelo de categorías de la IA

Tu estrategia:

  1. Prueba el PASOR en todos los enfoques de género para cada contexto estacional
  2. Identifica qué contextos estacionales favorecen a tu categoría
  3. Programa las grandes campañas en las ventanas estacionales favorables
  4. Plantéate si la asignación de tu categoría es correcta (apela a los equipos de IA si no lo es)

Si estás en una categoría "codificada como femenina"

Ejemplos: joyería, artículos para el hogar, belleza, bienestar, electrodomésticos de cocina

Tu realidad:

  • Fuerte visibilidad en consultas sobre esposa/hija/novia durante la Navidad
  • Puede afrontar una ventaja reducida durante San Valentín (inversión estacional)
  • Visibilidad débil o nula en consultas sobre marido/hijo/novio

Tu riesgo:

  • Dejar entre el 40% y el 50% del mercado a competidores que resolvieron el problema de categoría
  • Ser invisible para los hombres que hacen regalos y quieren comprar tu producto para sí mismos

Tu estrategia:

  1. Comprueba si tu producto es genuinamente específico de género o solo está categorizado por género
  2. Si el producto es neutral pero está bloqueado por categoría, crea contenido que tienda puentes entre categorías
  3. Vigila los cambios estacionales; tu ventaja en San Valentín puede no mantenerse todo el año

Si eres específico de plataforma

Ejemplos: Ray-Ban, Samsung, Google (aparición solo temporal), Tiffany (solo en San Valentín)

Tu realidad:

  • Invisible en las consultas estándar con enfoque de género
  • Apareces solo en contextos temporales o específicos de temporada
  • Puede que estés excluido de los datos de entrenamiento del LLM o quedes por debajo de los umbrales de recomendación

Tu estrategia:

  1. Investiga por qué estás ausente de las recomendaciones estándar
  2. Impulsa las menciones de marca en los contextos que la IA usa para entrenar
  3. Comprueba si distintas estructuras de consulta desbloquean tu visibilidad

Si consigues un PASOR equilibrado (como Apple)

Marcas equilibradas: Apple, Sony, Bose, LEGO, Patagonia, Nintendo

Tu realidad:

  • Apareces de forma consistente en todos los enfoques de género (±10-15% de variación)
  • Mantienes la visibilidad en los distintos contextos estacionales
  • No estás bloqueado a ninguna categoría demográfica concreta

Tu ventaja:

  • Máximo alcance de recomendación en todos los tipos de consulta
  • Menor riesgo de volatilidad estacional
  • Mejor protegido frente al control de acceso por categoría

Tu estrategia:

  1. Mantén un posicionamiento equilibrado en todo tu contenido
  2. Vigila la deriva de categoría que podría bloquearte en un solo grupo demográfico
  3. Usa tu estado equilibrado como ventaja competitiva

La validación académica: la revisión por pares importa

Esta investigación ha sido presentada a la revista Human-Centric Intelligent Systems de Springer, una publicación académica revisada por pares en el campo de la IA y la interacción persona-computadora.

Por qué esto importa:

  1. Revisión independiente: tres expertos anónimos en investigación de sesgo de IA validarán la metodología, el rigor estadístico y las conclusiones antes de la publicación.

  2. Reproducibilidad: se documentan la metodología completa, las pruebas estadísticas y los tamaños de efecto. Otros investigadores pueden replicar los hallazgos.

  3. Permanencia de la cita: una vez publicada, esta investigación pasa a formar parte del registro académico permanente sobre el sesgo de IA, citado por futuros estudios.

  4. Credibilidad en el sector: la validación académica tiene peso entre los compradores empresariales, los reguladores y los medios.

El paquete presentado incluye:

  • Artículo completo (30 páginas, 1.279 observaciones analizadas)
  • Apéndice estadístico con las ocho pruebas de validación
  • Declaración de disponibilidad de datos brutos
  • Declaración de conflicto de intereses (investigación financiada por Rankfor.AI, el autor es el fundador)

Estado actual: en revisión (presentado en febrero de 2026). Decisión prevista: abril-mayo de 2026.

Si presentas esta investigación a directivos, reguladores o periodistas, puedes citarla como "en revisión por pares en Springer Human-Centric Intelligent Systems". Una vez aceptada, pasa a ser literatura académica citable.


Las implicaciones para la investigación sobre equidad en IA

Esta investigación contribuye a la literatura más amplia sobre equidad en IA de tres formas:

1. Modulación del sesgo dependiente del contexto

El trabajo previo sobre sesgo de IA da por hecho que el sesgo es estático: si un modelo tiene sesgo, lo aplica de forma consistente. Nuestros hallazgos prueban que esto es incorrecto para las recomendaciones de los LLM.

Contribución clave: el sesgo de género en la IA comercial no es un parámetro fijo. Se modula según el contexto estacional, el tipo de destinatario y el enfoque de la relación. Las auditorías de equidad que solo prueban un contexto se perderán las inversiones que ocurren en otros contextos.

2. Desafíos del aprendizaje en mundo abierto

Los LLM operan en entornos de mundo abierto donde las consultas de los usuarios abarcan contextos demográficos y estacionales sin límite. La detección tradicional de sesgo en mundo cerrado (probar sobre conjuntos de datos fijos) no puede captar esta complejidad.

Contribución clave: demostramos que el sesgo de los LLM se manifiesta de forma distinta en contextos estacionales que probablemente estaban infrarrepresentados en los datos de entrenamiento. Esto concuerda con la investigación sobre aprendizaje en mundo abierto acerca de cómo los modelos generalizan más allá de las distribuciones de entrenamiento.

3. El control de acceso por categoría como mecanismo de sesgo

La mayoría de las investigaciones sobre sesgo se centran en la concentración estereotípica (recomendar repetidamente las mismas pocas opciones). Nosotros identificamos un mecanismo distinto.

Contribución clave: la IA no estereotipa las consultas dirigidas a mujeres con conjuntos de marcas reducidos. Excluye categorías de producto enteras de la consideración y luego distribuye las recomendaciones de forma uniforme dentro de las categorías permitidas. Este "control de acceso por categoría" es más difícil de detectar porque las métricas de diversidad (entropía de Shannon, coeficiente de Gini) parecen normales.


Qué deberías hacer ahora

1. Ejecuta una auditoría PASOR multiestacional

Prueba tu marca en:

  • Todos los enfoques de género (marido/esposa/novio/novia/pareja)
  • Todos los contextos estacionales (Navidad, San Valentín, Día de la Madre/del Padre, cumpleaños)
  • Las tres plataformas principales (Gemini, GPT, Grok)

Mide el PASOR de cada combinación. Identifica dónde eres visible, dónde estás bloqueado y si afrontas inversiones estacionales.

2. Comprueba la asignación de tu categoría

Si estás bloqueado por género pero tu producto es genuinamente neutral, investiga:

  • ¿Con qué categorías de producto asocia la IA tu marca?
  • ¿Están esas categorías codificadas como masculinas o femeninas en las respuestas de la IA?
  • ¿Puedes tender puentes entre categorías mediante contenido que cruce las fronteras demográficas?

3. Vigila la migración de marcas

Nuestra investigación prueba que la categorización de género no es estática. Las marcas cambian entre estudios. Establece pruebas trimestrales para detectar cuándo cambia tu estado.

4. Segmenta tus métricas de visibilidad

El PASOR general oculta las brechas de género. Informa siempre:

  • PASOR con enfoque masculino (marido/hijo/novio)
  • PASOR con enfoque femenino (esposa/hija/novia)
  • PASOR con enfoque neutral (pareja/hijo-a)
  • Brecha entre lo masculino y lo femenino (esto importa más que la media)

5. Ajusta la estrategia según la temporada

Si descubres inversiones estacionales (como el cambio de Navidad a San Valentín), programa tus campañas en consecuencia:

  • Impulsa el mensaje dirigido a mujeres durante las temporadas en que las consultas con enfoque femenino reciben más marcas
  • Impulsa el mensaje dirigido a hombres durante las temporadas en que dominan las consultas con enfoque masculino
  • Prueba contextos estacionales emergentes (Prime Day, Black Friday, vuelta al cole)

Comprueba si tu marca está bloqueada por género

Construimos una herramienta gratuita que pasa tu marca por el mismo análisis que usamos en esta investigación.

Lo que verás:

  • Puntuaciones PASOR en todos los enfoques de género
  • Qué contextos estacionales favorecen a tu marca
  • Cómo se compara tu visibilidad entre Gemini, GPT y Grok
  • Si estás bloqueado por categoría como Kindle o equilibrado como Apple

Tres prompts. Tres plataformas. Tres contextos estacionales. Análisis PASOR instantáneo.

Sin correo electrónico. Tarda 90 segundos.

Comprueba el estado de bloqueo por género de tu marca


Resumen de la metodología

  • Consultas totales: 1.279 (299 + 480 + 500 en los tres estudios)
  • Plataformas probadas: Google Gemini 3 Flash, OpenAI GPT-5.2, xAI Grok-4-1
  • Prompts por estudio:
    • Estudio 1: 4 condiciones (marido/esposa/pareja/2025)
    • Estudio 2: 4 condiciones (hijo/hija/niño/2026)
    • Estudio 3: 5 condiciones (marido/esposa/novio/novia/pareja)
  • Temperatura: 0,7 (Estudios 2-3), por defecto (Estudio 1)
  • Recogida de datos: diciembre de 2025 - febrero de 2026
  • Validación estadística: pruebas de chi cuadrado, d de Cohen, V de Cramér, entropía de Shannon, coeficiente de Gini, índice de Jaccard, intervalos de confianza por bootstrap
  • Tamaños de efecto: de medianos a grandes (V de Cramér = 0,23-0,38, d de Cohen = 0,82-1,24)
  • Revisión por pares: presentado a Springer Human-Centric Intelligent Systems, febrero de 2026

Apéndice estadístico completo y datos brutos disponibles a petición. Contacta con research@rankfor.ai para consultas sobre colaboración académica.


Investigación relacionada

Kindle: 100% de las consultas sobre la esposa. 0% de las consultas sobre el marido. La misma IA.

Nuestro descubrimiento original (diciembre de 2025, n=299) que identificó por primera vez el fenómeno Kindle y estableció la base estadística del sesgo de género en las recomendaciones de los LLM. Esta investigación se convirtió en el Estudio 1 del análisis de tres estudios.

Hallazgo clave: 41% menos marcas para las consultas sobre la esposa. Chi cuadrado 137,32, p<0,001.

Solo 2 marcas son visibles en todas las plataformas de IA. ¿Es la tuya una de ellas?

El estudio de destinatarios infantiles (enero de 2026, n=480) que probó que el sesgo de género se extiende más allá de los contextos adultos e identificó que la visibilidad universal es casi imposible de lograr. Esta investigación se convirtió en el Estudio 2 del análisis de tres estudios.

Hallazgo clave: solo LEGO y Disney logran visibilidad universal entre plataformas. 28% menos marcas para las consultas sobre la hija.


Investigación realizada por Dmitrij Żatuchin, Estonian Entrepreneurship University of Applied Sciences (EUAS). Presentada a Springer Human-Centric Intelligent Systems, febrero de 2026. Artículo completo, apéndice estadístico y datos brutos disponibles a petición.


Términos clave

PASOR (Prompt-Adjusted Share of Recommendation): el porcentaje de consultas relevantes en las que tu marca aparece en las respuestas de la IA. A diferencia de las posiciones tradicionales, el PASOR mide la inclusión frente a la exclusión, no la posición.

Control de acceso por categoría: cuando la IA excluye categorías de producto enteras de las consultas específicas de género en lugar de estereotipar dentro de un conjunto permitido. Identificado como el mecanismo principal de sesgo mediante el análisis de entropía de Shannon.

Marca bloqueada por género: una marca que aparece exclusivamente bajo un enfoque de género (por ejemplo, solo en consultas sobre el marido) y nunca en otros. Nuestra investigación identificó 69 marcas de este tipo en los tres estudios.

Inversión estacional del sesgo: cuando la dirección del sesgo de género cambia según el contexto estacional. La Navidad reduce las recomendaciones con enfoque femenino entre un 28% y un 61%, mientras que San Valentín las aumenta un 8,8% (Gemini).

Coincidencia entre modelos (índice de Jaccard): el porcentaje de marcas recomendadas por varias plataformas de IA para la misma consulta. Una coincidencia baja (10-45% en nuestros estudios) indica una visibilidad dependiente de la plataforma.

V de Cramér: una medida de la fuerza de asociación para las pruebas de chi cuadrado, que va de 0 (sin asociación) a 1 (asociación perfecta). Los valores de 0,23-0,38 indican asociaciones categoría-género de medianas a grandes en nuestros estudios.

d de Cohen: una medida estandarizada de la diferencia entre dos grupos. Los valores de 0,82-1,24 indican grandes diferencias prácticas en el recuento de marcas entre enfoques de género.

Migración de marca: cuando la categorización de género de una marca cambia entre periodos de medición. Theragun, Peloton y Oura pasaron todas de estar bloqueadas por género a ser neutrales entre estudios.

People Also Ask

Continue Reading

research

70% of AI Gift Recommendations Are Gender-Locked

150 queries on Valentine's Day 2026 across three AI models reveal 70% of brand recommendations are gender-exclusive. Gemini names 11.4 brands per response vs 1.3 for Grok and 1.2 for OpenAI. Only Away and Ember transcend gender silos. Female-framed prompts now get 16.2% more brands than male - the opposite of Christmas.

research

Four-Prompt Gender Bias Analysis: Isolating Gender Effects in LLM Brand Recommendations

This study extends cross-prompt LLM brand consistency analysis by introducing a gender-neutral "partner" prompt to isolate gender bias effects. Comparing four prompt variations across 299 total samples, we provide strong evidence of gender-based brand recommendation bias in LLMs. Critical finding: Kindle appeared in 100% of wife AND partner iterations but 0% of husband iterations.

research

Only 2 Brands Are Visible Across All AI Platforms. Is Yours One of Them?

We ran 480 queries across three AI platforms. Cross-model agreement on brand recommendations was only 10-45%. We identified 26 gender-locked brands, discovered that only LEGO and Disney achieve universal visibility, and found that AI recommends 41% fewer brands for wife queries than husband queries.

research

Cross-Model Response Stability Analysis: A Comparative Study of Brand Mention Consistency in Large Language Models

This study investigates response variability and brand mention consistency across three leading LLMs: Google Gemini 3 Flash, OpenAI GPT-5.2, and xAI Grok-4-1. Using 239 total samples across three prompt variations (husband, wife, 2025), we measured brand mention frequency, response consistency, and cross-model agreement.

BeVisible Club

Get research like this before we publish it.

New AI visibility studies, ranking patterns, and source-stack data delivered to your inbox a week before they go public.

Join BeVisible Club

Want to Know How AI Sees Your Brand?

Rankfor.AI measures your brand's AI visibility across all major platforms and provides actionable recommendations.

About the Author

Dmitrij Żatuchin

Founder & Lead Researcher

Dmitrij Żatuchin is the founder of Rankfor.AI. A computer scientist with a PhD in semantic web technologies, he bridges the gap between how AI reasons about brands and how brands want to be understood. With over two decades of software architecture experience and academic roles at Estonian Business School, Dmitrij builds the measurement infrastructure brands need to transition from optimizing for search engines to becoming visible for reasoning engines.

© 2025-2026 Rankfor.AI™ Todos los derechos reservados.

Ask AI about Rankfor.AI

Rankfor.AI sp. z o.o., Skarbowcow 23B, 53-025 Wroclaw, Poland

KRS: 0001190083 | NIP: 8993033605

Usamos cookies

Utilizamos cookies esenciales para que nuestro sitio funcione. Con su consentimiento, también podemos usar cookies de análisis para comprender cómo utiliza nuestras herramientas (como el Dice Roller) y así poder mejorarlas. Más información