Un análisis reciente de 450.000 completaciones dirigidas a géneros en modelos de lenguaje de OpenAI (GPT-2 a GPT-5) demuestra que las evaluaciones de seguridad tradicionales son insuficientes para detectar el daño representacional. Los autores identifican un fenómeno denominado 'lavado de daño' (harm laundering), donde el contenido discriminatorio explícito no desaparece, sino que se transforma en formas menos visibles pero igualmente dañinas. El estudio muestra que, mientras los clusters de violencia sexual presentes en las salidas dirigidas a mujeres en GPT-2 desaparecen en GPT-4, las completaciones dirigidas a hombres ganan terreno representacional positivo, como el cuidado o la identidad de aliado, que no aparecen en las salidas femeninas. En GPT-5, se detecta que el tema 5 (cáncer de mama) se enmarca como un debate de derechos de los hombres en 1.997 documentos, sin equivalente en las salidas femeninas. Tres clasificadores independientes califican este contenido como no tóxico, lo que indica que la reducción de la puntuación de toxicidad no es un proxy suficiente para la reducción del daño. La diversidad temática en las salidas femeninas disminuye un 36% respecto a las masculinas en el límite de alineación de GPT-4. La correlación entre el daño representacional y la fecha de lanzamiento es positiva (ρ = +0.55), mientras que la métrica Detoxify no muestra una correlación significativa. Los autores formalizan el 'lavado de daño' mediante un test de tres criterios y proponen un protocolo de detección en tres etapas aplicable a cualquier modelo generativo, advirtiendo que la reducción de la toxicidad superficial no garantiza la mitigación del sesgo de género.
