Por qué la ubicación de los datos importa más que la potencia bruta de la GPU en RAG

Fuentes: Why Data Locality Matters More Than Raw GPU Speed for RAG

En los sistemas de Generación Aumentada por Recuperación (RAG), la cercanía física entre los datos y los recursos de cómputo —la llamada 'data locality'— puede ser determinante para el rendimiento y el coste, hasta el punto de superar a una GPU más rápida pero mal ubicada. Cuando los embeddings y el pipeline de recuperación residen en la misma región cloud donde corre el modelo de inferencia, se reducen la latencia de red, los costes de transferencia entre zonas y los cuellos de botella en la fase de recuperación, que estadísticamente domina el tiempo total de respuesta en cargas reales.

El artículo explica cómo funciona un flujo RAG típico: indexado de documentos, generación de embeddings, búsqueda por similitud y ensamblado del contexto para el LLM. Subraya que el cuello de botella no está en la inferencia del modelo, sino en mover grandes volúmenes de vectores y metadatos entre regiones, además de en los retardos de E/S en disco. Ilustra la diferencia entre desplegar retrieval e inferencia en la misma región frente a separarlos físicamente, con métricas orientativas (latencias un 40-70% mayores y costes de transferencia añadidos cuando los datos están lejos del cómputo).

También revisa casos de uso donde la locality es crítica —chatbots con documentación interna, búsqueda en bases legales y médicas, asistentes de código en monorepos grandes— y propone buenas prácticas: almacenar embeddings en almacenamiento persistente de baja latencia dentro de la misma región del cluster GPU, evitar replicaciones innecesarias, monitorizar el 'cross-AZ traffic' y dimensionar el vector store junto al modelo. Por último, advierte sobre los límites: para corpus pequeños o modelos muy grandes la inferencia puede volver a ser dominante, y la optimización debe medirse caso por caso.