La francesa Kog quiere exprimir más rendimiento de las GPU mediante software

Fuentes: Kog is going deeper to squeeze more inference out of GPUs

La startup francesa Kog, fundada en solitario por Gaël Delalleau, asegura que es posible acelerar drásticamente la inferencia de modelos de inteligencia artificial en GPU estándar mediante optimización por software, frente a quienes consideran necesarias soluciones de hardware a medida como los chips de Cerebras. Su demo de mayo alcanzó 3.000 tokens por segundo y petición con el modelo Laneformer 2B, de 2.000 millones de parámetros, ejecutado en una AMD MI300X y una NVIDIA H200. La publicación en Hacker News generó más de 200 contactos comerciales, principalmente de empresas que usan flujos de trabajo de IA con tareas profesionales y están dispuestas a pagar por reducir los tiempos de espera.

Kog trabaja ahora en demostrar que su Kog Inference Engine puede lograr una inferencia diez veces más rápida en grandes modelos de lenguaje. Delalleau estima que la primera demostración pública llegará en septiembre, paso previo a una serie A. La empresa cuenta con un equipo de once personas y un proceso manual, de varias semanas por GPU, inspirado en su experiencia en hacking ofensivo y física del estado sólido. Entre sus apoyos figuran Scaleway, Bpifrance y el programa French Tech 2030. Competidores como la francesa ZML también buscan acelerar la inferencia con software agnóstico del hardware.