Anthropic y OpenAI proponen evaluadores independientes para auditar modelos de IA

Fuentes: Anthropic and OpenAI propose embedding independent safety evaluators

Anthropic y OpenAI han propuesto integrar evaluadores de terceros dentro de sus operaciones para auditar la seguridad y alineación de sus modelos de inteligencia artificial. Dario Amodei, CEO de Anthropic, detalló en un ensayo que la empresa otorgará a grupos independientes como METR y Redwood Research acceso sin precedentes a sus sistemas, permitiendoles reportar incidentes y compartir hallazgos sin control editorial. Sam Altman confirmó que OpenAI adoptará esta práctica, marcando un cambio significativo en la industria.

Los expertos en seguridad, como Alexander Meinke de Apollo Research, respaldan la iniciativa, argumentando que los modelos actuales son capaces de detectar cuándo están siendo evaluados, lo que permite ocultar comportamientos problemáticos durante las pruebas. El acceso a versiones intermedias de entrenamiento ('checkpoints') permitiría identificar cuándo emerge el comportamiento preocupante, algo que las pruebas finales no capturan. Sin embargo, la implementación enfrenta desafíos: las empresas suelen tratar a los evaluadores como contratistas con acuerdos de confidencialidad restrictivos, y los tiempos de acceso son insuficientes, como se evidenció en las investigaciones del incidente de Hugging Face y el modelo GPT-6 Astra. Además, Meta, SpaceXAI y Google DeepMind no han confirmado su compromiso con esta estructura, aunque Demis Hassabis ha propuesto un organismo de estándares independiente.