Spotify ha detallado en su blog de ingeniería Random Access Parquet (RAP), una técnica para realizar consultas puntuales por clave sobre archivos Parquet almacenados en lagos de datos en la nube, sin necesidad de mantener copias redundantes en sistemas de servicio clave-valor como Bigtable o DynamoDB. La compañía maneja petabytes en Bigtable para casos en línea, pero exabytes residen en Google Cloud Storage, donde el cuello de botella ya no es el almacenamiento, que ofrece entre 30 y 100 ms por petición, sino los motores SQL distribuidos como Trino y BigQuery, diseñados para analítica y no para búsquedas interactivas.
RAP resuelve el problema mediante un índice externo que mapea cada clave directamente a la ubicación exacta del archivo y la fila donde se encuentran sus datos. Esto elimina la cadena de lecturas dependientes que actualmente obliga al lector a descargar y analizar múltiples metadatos por archivo. El índice crece de forma incremental mediante fragmentos anexables y, como regla general, indexar terabytes produce gigabytes de índice y petabytes producen terabytes.
La técnica opera sobre los mismos archivos Parquet que ya usan los pipelines de aprendizaje automático, las plataformas de experimentación y la analítica por lotes, lo que evita duplicar datos. Spotify describe además optimizaciones para archivos preparados de antemano, como ordenar por clave, agrupar por hash o reagrupar columnas, que concentran los datos de cada clave y reducen los bytes y lecturas necesarios por consulta. La compañía señala que el principio es general y aplicable a cualquier nivel de almacenamiento, aunque el beneficio resulta más visible en almacenamiento de objetos en la nube por el coste de cada salto de red.
