La CPU recupera protagonismo en la inferencia de modelos de lenguaje

Fuentes: The CPU is back: Rethinking the CPU-GPU split for LLM inference

La arquitectura tradicional de inferencia de modelos de lenguaje asigna a la GPU la mayor parte del cómputo y deja a la CPU en un papel secundario de coordinación. Sin embargo, la irrupción de la IA agéntica y el despliegue de modelos más pequeños y especializados está cuestionando esa división. En un sistema agéntico, una sola consulta del usuario puede descomponerse en decenas de llamadas a herramientas, ejecución de código y bucles de razonamiento que recaen sobre la CPU. Investigadores de Georgia Tech e Intel estiman que el procesamiento de herramientas en la CPU representa entre el 50 % y el 90 % de la latencia total en este tipo de cargas. Datos de Intel correspondientes al primer trimestre de 2026 muestran un cambio claro en la ratio CPU-GPU: de 1:8 en entrenamiento se ha pasado a 1:4 en inferencia y hasta 1:1 o 4:1 en cargas agénticas. Arm pronostica que los centros de datos de IA necesitarán 120 millones de núcleos de CPU por gigatio, cuatro veces más que en la era pre-agéntica. El artículo explica además las diferencias arquitectónicas entre CPU y GPU, por qué los modelos pequeños y locales favorecen a la CPU y qué implicaciones tiene este cambio para el diseño de centros de datos y proveedores de hardware.