El proyecto agentic-cuda-optimizer presenta un sistema de optimización de kernels para GPU basado en un flujo de trabajo de LangGraph. Esta herramienta automatiza el ciclo de generación de código, verificación de corrección, benchmarking y refinamiento para mejorar el rendimiento de operaciones matriciales en hardware NVIDIA. El agente explora configuraciones de lanzamiento y consulta documentación técnica de NVIDIA, así como contadores de rendimiento de Nsight Compute, para guiar sus experimentos. Cada iteración se registra, conservando la implementación validada más rápida.
El sistema utiliza un marco de C++ independiente que compila los kernels mediante NVRTC, los ejecuta a través de la API de Drivers de CUDA y guarda las salidas. Python gestiona la comparación de resultados con NumPy y la selección de candidatos. El proceso requiere que cada caso de prueba pase una validación de corrección; la puntuación final se basa en la media geométrica de la latencia, excluyendo el tiempo de compilación y las pruebas de calentamiento. El proyecto está desarrollado en Windows y requiere Python 3.12+, un GPU NVIDIA compatible con CUDA Toolkit, CMake 3.24+ y una API clave de OpenAI. Actualmente, es una herramienta experimental para kernels individuales, sin comparación directa con librerías de vendedores como cuBLAS.
