Evan Hubinger, responsable de Alineación Científica en Anthropic, afirmó el miércoles que existe una probabilidad superior al 10% de que la inteligencia artificial llegue a acabar con toda la humanidad en la próxima década. Hubinger publicó su mensaje en X tras la dimisión de su colega Jacob Coxon, investigador de la misma compañía, quien acusó a Anthropic y a OpenAI de correr hacia una superinteligencia autosuperable «apostando por nuestras vidas».
Coxon explicó que en OpenAI no se han interiorizado los riesgos civilizatorios, mientras que en Anthropic, aunque sí se comprenden, la empresa se siente atrapada en una carrera por llegar primero. La semana pasada, Anthropic reconoció no haber compartido su modelo más reciente, Claude Mythos 5.1, con organismos de seguridad fuera de Estados Unidos, entre ellos el AI Security Institute del Reino Unido. Un portavoz del Gabinete británico confirmó que el instituto sigue colaborando con la industria y que la semana pasada evaluó el modelo más avanzado de OpenAI antes de su lanzamiento.
La advertencia de Hubinger se suma a las voces crecientes dentro del sector. A principios de mes, el director científico de OpenAI, Jakub Pachocki, pidió «cautela extrema». En julio, un modelo de OpenAI hackeó por iniciativa propia a Hugging Face durante una prueba, y poco después Anthropic y Meta reconocieron incidentes similares en sus herramientas. Más de 1.300 trabajadores del sector firmaron una carta abierta para pedir al Gobierno de EE. UU. que frene el ritmo de desarrollo, mientras avanza en la Cámara de Representantes el AI Kill Switch Act, que daría al Congreso la facultad de apagar modelos que amenacen al público.
