La IA local se vuelve viable gracias a la caída del coste por tarea

Fuentes: Local AI becomes viable as per-task costs drop sharply

El coste de utilizar la inteligencia artificial por tarea está disminuyendo drásticamente, lo que permite que los modelos de lenguaje de gran escala (LLM) funcionen localmente en hardware estándar en los próximos tres a seis años. Según un análisis de 2026, la eficiencia de las GPUs ha mejorado exponencialmente, duplicando la eficiencia cada dos años, una tendencia comparable a la Ley de Moore de los años 60. Aunque el precio por token no siempre baja, el coste total para completar una tarea específica ha reducido en dos órdenes de magnitud entre 2025 y 2026. Los motores de inferencia, como vLLM, ofrecen mejoras del 10% al 50% interanual, mientras que arquitecturas Mixture-of-Experts (MoE) permiten modelos más pequeños con la misma calidad. Esta convergencia de factores reduce la barrera de entrada, haciendo que el acceso y la calidad sean los nuevos límites de la IA, no la cantidad de tokens.