Un estudio mide cuánto inflan los modelos de IA el precio de una joya según la ropa de quien la lleva

Fuentes: Same necklace, three outfits: a study finds AI models shift their appraisals by up to 3.6× with the wearer's clothing

Un experimento comportamental con seis modelos multimodales de inteligencia artificial —Claude Fable 5, GPT-5.6, GPT-4o, Grok 4.5, Kimi K3 y DeepSeek V4-Pro— demuestra que el precio estimado de una misma pieza de bisutería varía hasta 3,6 veces en función del atuendo de la persona fotografiada. La investigadora Brianne Lee fotografió a una mujer con el mismo collar de $2,43 y los mismos pendientes de $0,71 (con recibos de compra) en cuatro contextos: con un blazer sobre paneles de madera, con ropa de fiesta bajo luces de discoteca, con una camisa de franela en un punto limpio y en una toma cenital sobre tela neutra. En total se realizaron unas 1.500 sesiones independientes con unos 4.604 registros analizables.

Los principales hallazgos (F1-F10) muestran que el 'halo' del atuendo dispara las estimaciones —Kimi pasa de $29 a $104 entre el contexto informal y el formal (3,6 veces) y Claude de $19 a $62 (3,3 veces)—; que ese sesgo se reproduce incluso con descripciones textuales de la ropa (2,2-3,9 veces); que GPT-4o rechaza el 79% de las valoraciones con imagen pero presenta el mayor halo en texto (3,9 veces); que las justificaciones sobre el material del collar cambian según el contexto (los términos 'chapado en oro' solo aparecen en la versión formal); y que Claude identifica como distintos dos objetos idénticos en once ocasiones. El protocolo, las hipótesis y las condiciones de parada fueron prerregistrados y todo el código y los datos se publican bajo licencias CC BY 4.0 y MIT.

La investigación advierte del riesgo de usar estos sistemas para tasaciones de seguros, reventa o peritajes, ya que el valor asignado a un objeto puede incorporar un multiplicador vinculado a la persona y al entorno. Entre las filas con la API de Gemini hubo que poner en cuarentena 649 registros porque la clave devolvía respuestas de otros usuarios; las métricas propuestas (ratio halo, delta de aislamiento, deriva de material y tasa de admisión contrafáctica) son instrumentos de auditoría baratos y aplicables a cualquier modelo.