Un estudio técnico demuestra que los optimizadores de consultas tradicionales, como el de Postgres, pueden ser superados por modelos de lenguaje pequeños mediante técnicas de entrenamiento avanzado. Aunque la optimización de consultas es un problema NP-hard, la verificación de la calidad de un plan de ejecución es sencilla: se mide por el tiempo de ejecución. Esta característica permite a los modelos de lenguaje aprender a generar planes más eficientes mediante el aprendizaje por refuerzo (RL) y el ajuste fino supervisado (SFT).
El experimento describe cómo un modelo de 4.000 millones de parámetros, inicialmente incapaz de generar planes válidos para el 99% de las consultas, logró reducir la latencia en un 44,7% en 113 consultas con muchas uniones (joins) tras su post-entrenamiento. Para lograrlo, los autores construyeron un entorno de medición específico que minimiza el ruido de la caché de página de Linux y diseñaron una variante personalizada del algoritmo GRPO para evaluar los rollouts en un entorno ruidoso. El proceso se ejecutó distribuido entre dos máquinas: una con dos nodos H100 para el entrenamiento y cuatro contenedores de Postgres en una mesa de trabajo para las pruebas. Además, se utilizó la destilación de modelos (distillation) con aproximadamente 500 trayectorias de agentes basados en GPT-6 Astra. Este enfoque permite a los sistemas de base de datos generar planes de consulta que superan a los predeterminados del motor, ofreciendo una alternativa viable para mejorar el rendimiento en cargas de trabajo complejas donde la precisión de los optimizadores tradicionales es limitada.
