DigitalOcean publica una guía técnica para ejecutar cargas de trabajo de GPU en DigitalOcean Kubernetes (DOKS) utilizando nodos Spot, una modalidad de infraestructura que ofrece capacidad de cómputo a precios reducidos a cambio de poder ser interrumpida por el proveedor con poca antelación. El artículo explica por qué las GPU resultan caras en la nube y cómo los nodos Spot permiten recortar costes en entrenamiento, inferencia y otras tareas de inteligencia artificial, al tiempo que aborda el reto principal: la pérdida repentina de instancias.
La pieza detalla estrategias de resiliencia aplicables en Kubernetes, entre ellas la combinación de pools de nodos Spot y On-Demand, el uso de disruption budgets para limitar cuántas cargas pueden caer simultáneamente, el reparto de cargas mediante anti-affinity rules, los retries con backoff exponencial, el diseño de workloads sin estado (stateless) o con checkpoints, y el escalado horizontal automático para absorber picos. También revisa servicios gestionados compatibles como Spaces para almacenamiento de modelos o Gradient AI Platform para entrenar y desplegar modelos sin gestionar la infraestructura.
El texto está dirigido a ingenieros de MLOps, equipos de platform engineering y desarrolladores que ya trabajan con Kubernetes y necesitan optimizar el coste de sus cargas de GPU sin renunciar a la disponibilidad. Como consideraciones, advierte que las interrupciones Spot siguen requiriendo tolerancia a fallos en las aplicaciones y que los beneficios de precio dependen de la región y la demanda de capacidad.
