Un análisis técnico reciente compara el rendimiento de GPT-5.6 Luna y GPT-6 Astra en la revisión de código, destacando que el modelo de menor coste es suficiente para detectar la mayoría de los errores de corrección en entornos de desarrollo. En una prueba con 50 solicitudes de extracción (pull requests) basadas en benchmarks públicos, GPT-5.6 Luna identificó 69 errores verificados, frente a los 92 de GPT-6 Astra. La diferencia en coste es drástica: la revisión completa con Luna costó 0,20 dólares, mientras que con Astra ascendió a 5,66 dólares, una diferencia de 28 veces en el coste por revisión.
A pesar de que Luna encontró menos errores críticos, su precisión en la detección de errores de seguridad fue inferior, con solo 9 de los 24 hallazgos de seguridad validados, frente a los 19 de Astra. Los autores del estudio concluyen que Luna es adecuada para detectar errores de corrección generales, pero no debe usarse para revisar lógica de autenticación o permisos por sí sola, dado su mayor tasa de falsos positivos. El análisis también reveló que, aunque Luna fue más rápida (23 segundos por revisión) y generó más tokens de salida, su capacidad para detectar errores de concurrencia y seguridad es limitada. Se estima que combinar ambos modelos permitiría detectar el 82% de los errores verificados, aunque el coste total se duplicaría.
