La selección de un orquestador de inferencia autoalojado depende de la infraestructura disponible y los requisitos de escalabilidad. En septiembre de 2026, herramientas como Ollama y llama.cpp son ideales para un solo dispositivo, ofreciendo compatibilidad con la API de OpenAI y una interfaz de usuario sencilla. Para entornos multi-máquina, vLLM destaca por su capacidad de paralelismo tensor y pipeline mediante Ray, mientras que LiteLLM actúa como un enrutador que gestiona claves y presupuestos entre múltiples proveedores sin ejecutar modelos directamente.
LocalAI se posiciona como la solución más completa para usuarios generales, ofreciendo soporte para texto, imágenes, audio y video mediante gRPC, con un modo distribuido basado en libp2p que permite la federación de nodos. Sin embargo, su rendimiento bruto en LLMs es inferior al de los motores dedicados. Exo es la opción superior para hardware Apple Silicon, utilizando RDMA sobre Thunderbolt 5 para escalar el paralelismo tensor en macOS, aunque aún no está disponible para Linux. En el sector empresarial, GPUStack y Xinference ofrecen consolas de gestión con métricas, roles y soporte para múltiples proveedores de aceleradores, siendo las soluciones más desplegadas en clústeres en Asia. Finalmente, NVIDIA Dynamo y llm-d resuelven problemas de infraestructura de datacenter con enrutamiento consciente de KV, mientras que SkyPilot y dstack se enfocan en la orquestación de trabajos a través de la nube y servidores locales.
