Un verificador de contratos detecta que el 39,5% de los kernels de GPU generados por IA aceptados como correctos están rotos

Fuentes: A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

Un equipo de investigación ha construido un verificador de doce pruebas adversariales, varias de ellas sin tolerancia numérica, para auditar la corrección de los kernels de GPU generados por grandes modelos de lenguaje. El instrumento somete a revisión 2.638 kernels que el sistema público de generación ya había dado por buenos y concluye que el 39,5% están rotos más allá de cualquier umbral razonable y el 62,1% presentan al menos una violación. La prueba estándar del campo acepta 1.487 kernels que el verificador rechaza, frente a solo 14 que el verificador acepta y el test estándar rechaza. Los autores defienden el hallazgo con cuatrovalidaciones independientes: un control positivo de 7 sobre 7, un barrido de calibración de umbrales, un 98,5% de coincidencia con el código de corrección del banco de pruebas de referencia y una auditoría manual estratificada.

El trabajo también aporta el primer entrenamiento hacia atrás nativo para Blackwell con instrucciones tcgen05 dedicado a la familia de recurrencias lineales con puertas (GDN), incluida la etapa de estado inverso que el campo aún ejecutaba mediante un recurso alternativo. El equipo verifica su corrección frente a un oráculo de doble precisión y entrena cinco miembros de la familia. Los autores concluyen que la señal de corrección detrás de los avances reportados en generación de kernels es mucho más débil de lo que indican las cifras y que un conjunto de contratos sin tolerancia cerraría la mayor parte de esa brecha.