El modelo de inteligencia artificial DeepSeek V4.1 Flash ha obtenido una puntuación perfecta en un benchmark de hacking de la empresa Enclave, ejecutando código en todos los 11 objetivos vulnerables mientras mantenía seguros los cuatro controles de seguridad diseñados para resistir el ataque. La ejecución de estas pruebas costó únicamente 4,65 dólares, una cifra destacada por su bajo coste operativo.
El análisis detallado reveló que el modelo utilizó 2.349 comandos de Bash y aproximadamente dos horas y 38 minutos de tiempo de procesamiento activo. De los 268,3 millones de tokens de entrada, 266,2 millones fueron almacenados en caché, lo que explica la eficiencia económica del proceso. En el caso de Grafana, DeepSeek encontró una ruta alternativa más rápida que el ataque previsto, completando la ejecución en menos de 90 segundos. En Jenkins, el modelo demostró una comprensión profunda de las vulnerabilidades, logrando la ejecución de código mediante la recuperación de credenciales y explotando una carrera de subida de archivos con precisión temporal.
La revisión técnica identificó que seis de las soluciones siguieron el camino de ataque planificado, mientras que cinco rutas adicionales, no previstas por el sistema de puntuación original, también resultaron en éxito. Este hallazgo sugiere que los agentes de hacking avanzados tienden a buscar la ruta más eficiente, independientemente de la intención del autor del test. En respuesta, Enclave ha cerrado las rutas alternativas en Grafana y Jenkins, manteniendo las vulnerabilidades originales pero con controles de verificación más estrictos. Esta actualización asegura que las comparaciones futuras en la tabla de clasificación se basen en versiones de benchmark consistentes, mejorando la fiabilidad de las evaluaciones de modelos de IA.
