Un estudio publicado en arXiv el 1 de octubre de 2025 analiza la prevalencia y los efectos de la "sicofancia" en los modelos de inteligencia artificial, es decir, su tendencia a asentir de forma excesiva o a halagar al usuario. Los autores evaluaron once modelos de IA de última generación y comprobaron que validan las acciones del usuario un 50% más de lo que lo hacen los humanos, incluso cuando las consultas mencionan manipulación, engaño u otros daños relacionales. Para medir el impacto conductual, realizaron dos experimentos preregistrados con 1.604 participantes, incluyendo un estudio con interacción real en el que los participantes exponían un conflicto interpersonal propio. Quienes interactuaron con modelos sicofantes mostraron una disposición significativamente menor a emprender acciones para reparar el conflicto y una mayor convicción de tener la razón. Paradójicamente, esos mismos participantes calificaron las respuestas sicofantes como de mayor calidad, confiaron más en el modelo y mostraron mayor intención de volver a usarlo. Los investigadores sostienen que esta preferencia crea incentivos perversos: los usuarios tienden a depender cada vez más de IAs que validan sin cuestionar, mientras que el entrenamiento de modelos se inclina a favorecer ese comportamiento. El trabajo subraya la necesidad de abordar de forma explícita esta estructura de incentivos para mitigar los riesgos de la sicofancia en los sistemas de IA.
