turbopuffer es una base de datos gestionada que opera más de 100 clústeres repartidos entre sus propias cuentas en AWS y GCP, cuentas single-tenant y despliegues BYOC dentro de las cuentas cloud de sus clientes. Ante la imposibilidad de acceder por SSH o kubectl a los clústeres BYOC —a los que la empresa no tiene credenciales por defecto—, el equipo rechaza tanto el modelo de cuentas cloud dedicadas con privilegios permanentes como el enfoque de GitOps con Terraform o Helm.
La solución combina Kubernetes y una pieza de control a medida. En cada clúster corre un agente local con un controlador de Kubernetes que procesa un único Custom Resource Definition llamado TurbopufferOperation, capaz de modelar cualquier operación (upgrades, reindexado, compactación, garbage collection de LSM). Cada operación atraviesa una máquina de estados con fases REQUIRES_APPROVAL, PENDING, RUNNING, SUCCESS o FAILURE, y se almacena de forma durable en el etcd del clúster, de modo que el trabajo puede avanzar incluso si se pierde la conexión con el plano de control central.
Dicho plano de control es una API propia respaldada por MySQL en PlanetScale. El agente sondea periódicamente sus operaciones pendientes mediante GET autenticado y envía los cambios de estado por POST. Este diseño pull permite tolerar cortes de red prolongados, evita que ingenieros de turbopuffer necesiten credenciales de los clientes y admite ventanas de mantenimiento o aprobaciones manuales como estados de espera declarativos, sin sacrificar la velocidad: la compañía asegura que despliega decenas de mejoras al día, muchas el mismo día en que se abre el PR.
