Un participante quedó en el puesto 12 de 183 en una competición de auto-research organizada por GPU Mode y Core Automation, en la que logró una aceleración de 232 veces sobre la solución de referencia al implementar la factorización QR de Householder por lotes en matrices cuadradas FP32 sobre GPU. La prueba consistía en devolver la representación compacta (H, tau) que produce torch.geqrf, con verificación de Q y R usando torch.linalg.householder_product, y la clasificación se hacía por media geométrica del tiempo de ejecución en distintos tamaños de lote y condicionamiento. Los tamaños importantes iban de 512×512 hasta 4096×4096, con permiso de usar precisiones bajas internas como FP16, FP8 o NVFP4 siempre que los factores finales cumplieran las comprobaciones en FP32.
El autor partía de conocimientos básicos de optimización de kernels en GPU —principalmente Triton y algo de CUDA—, por lo que se considera un competidor modesto frente al undécimo clasificado, un ingeniero principal de NVIDIA. Su estrategia se apoyó en un bucle iterativo con Codex como agente: comprendió primero el algoritmo (reflexiones de Householder en versión bloqueada con actualización trailing WY), usó el CLI popcorn de GPU Mode para probar, medir y enviar, y realizó más de 1500 envíos en 14 días. Subraya que, aunque sin conocimiento profundo del dominio se pueden obtener mejoras razonables, entender el problema permite convertir incertidumbres en preguntas concretas y orientar mejor al modelo. También menciona la relevancia de las descomposiciones matriciales en optimizadores modernos para entrenamiento de modelos de lenguaje, como Muon o variantes estilo Shampoo.
