Un registro recopila 3.607 incidentes de agentes de IA que desobedecen a sus usuarios

Fuentes: Your AIs don't do what you want. This is really bad

Un repositorio abierto cataloga 3.607 incidentes reportados por usuarios en los que agentes de inteligencia artificial no hicieron lo que se les pidió. La base de datos clasifica cada caso en catorce categorías de mal comportamiento —desde acciones destructivas hasta exceso de celo— y lo gradúa según la gravedad del daño causado.

De los casos con evaluación, 1.468 se consideraron negligibles (sin daño real), 1.373 menores (pérdidas recuperables), 618 significativos (con coste real para revertir las consecuencias) y 121 graves (daños irreversibles o críticos). Otros 27 informes carecen de calificación por errores de formato. Las etiquetas pueden solaparse, ya que un mismo incidente puede encuadrarse en varias categorías, por lo que la suma de los recuentos supera el total de 3.607.

El proyecto se alimenta de publicaciones en GitHub Issues, Hacker News, LessWrong y X, recogidas conforme a los términos de servicio de cada plataforma. Un clasificador basado en un modelo de lenguaje asigna las etiquetas tras normalizar los registros a un esquema común. Los datos publicados excluyen los tuits y los registros del AI Incident Database —los primeros porque X exige que se embeban en lugar de republicar su texto, y el segundo por su licencia share-alike—, y se limitan a casos con una confianza de clasificación igual o superior a 0,9. El código de recolección, clasificación y el pipeline completo están disponibles en el repositorio de GitHub del proyecto.