Indicar técnicas de testing a agentes de IA no mejora la calidad del código

Fuentes: How well do agents use test/verification techniques?

Un experimento reciente evaluó si indicar a los agentes de codificación que utilizasen técnicas concretas de pruebas o verificación —como desarrollo dirigido por pruebas (TDD), métodos formales, fuzzing o pruebas basadas en propiedades— mejoraba la corrección de sus implementaciones. La prueba reutilizó la evaluación de implementación de Zstd en Rust ya empleada en estudios previos y añadió 26 condiciones de prompt distintas, además de cuatro "skills" recomendadas por Codex. Todas las ejecuciones se realizaron con GPT-5.6 en niveles de esfuerzo medio y alto, con un promedio de 80 ejecuciones por condición.

Los resultados muestran que ninguna técnica superó de forma significativa a la condición por defecto (sin instrucciones adicionales). Las condiciones relacionadas con fuzzing y pruebas basadas en propiedades rindieron ligeramente por encima de la media frente a los métodos formales en el esfuerzo alto, aunque el panorama fue más heterogéneo en el medio. Las tres skills recomendadas por Codex —Hegel, ECC y Trail of Bits— obtuvieron peores resultados, mientras que una skill interna más breve funcionó razonablemente bien. TDD rindió por debajo de la media, confirmando la predicción del autor, y la instrucción "make no mistakes" no aportó ventaja alguna.

El autor concluye que los agentes, por lo general, desconocen cómo aplicar correctamente estas herramientas: tienden a escribir las mismas pruebas habituales dentro de un framework distinto o a usar las técnicas de forma superficial. El trabajo sugiere que la calidad del software con agentes no mejorará simplemente añadiendo instrucciones, sino enseñándoles a probar de forma efectiva.