Los modelos pequeños ya están aquí: barajar la frontera entre coste y capacidad

Fuentes: Small Models Have Arrived

Durante varias semanas el autor ha probado gpt-5.6-luna de OpenAI, un modelo rápido y económico capaz de mantener unos 100 tokens por segundo. La diferencia clave respecto a iteraciones anteriores es el coste por consulta: tareas de investigación complejas sobre miles de correos electrónicos se resuelven por decenas de céntimos de dólar, frente a aproximadamente un dólar con modelos de la generación Sonnet.

Esa caída de precios cambia la ecuación para los productos de consumo. Antes, para crear una aplicación viral había que levantar una web barata, captar usuarios y montar un mercado publicitario; sin embargo, añadir inferencia de IA dispara el capital necesario y rompe el manual tradicional de Google, Facebook o Snapchat. Un experimento personal —un diario de noticias personalizado para el inversor Calacanis— costaba alrededor de un dólar con la generación previa y baja a unos diez céntimos con luna.

La oportunidad se amplía en el ámbito empresarial. Peter Reinhardt, cofundador de Segment y responsable de Charm Industrial y Revoy, distingue dos tipos de trabajo: el de tipo "cociente intelectual 180", que exige razonamiento muy avanzado, y el "expulsor de tokens", mayoritario, basado en responder correos, empujar tareas y coordinar equipos. Según Reinhardt, alrededor del 95 % de su actividad cae en esta segunda categoría, la misma que dominan pequeños modelos rápidos y baratos. El artículo sostiene que la demanda de esa franja está a punto de despegar, siempre que la industria desarrolle arneses, permisos y defensas frente a inyecciones de prompt.